リリース直前だったボイスエージェントが、通話者を遮ってしまう問題が発生していました。中断率は18%に達し、リリースをわずか10日前に控えた段階で、発話終了判定(end-of-turn)ロジックの書き直しを余儀なくされました。無音タイムアウトのルールに文法チェックと相槌検出(back-channel detection)を追加したことで、中断率は3%まで低下し、システムが反応していないように感じさせていた長い無音状態も解消されました。

なぜ単一の無音タイムアウトでは不十分だったのか

当初の設計では、700msのポーズ(間)があればユーザーの発話が終了したと判断していました。静かな部屋で一人の話者が完全な文章を話すような、制御されたデモ環境であれば、そのルールはうまく機能します。しかし、実際の通話者は、考え込むために間を置いたり、数字をグループごとに区切って話したり、「うんうん」や「ええ」といった相槌を挟んで聞いていることを示したりします。エージェントは、それらのポーズをすべて発話の終了と解釈してしまっていたのです。

312件の実稼働通話を分析した結果、2つの問題が明らかになりました。第一に、話者が次のフレーズを構成している最中にエージェントが割り込んでしまい、発話の18%が損なわれていました。第二に、割り込みを防ぐためにタイムアウトを1500msまで延長したところ、システムの動作が鈍くなり、ノイズの多い回線で応答が止まってしまう現象が発生しました。背景ノイズが無音カウンターをリセットし続けてしまうため、エージェントが「ユーザーの発話が終わった」と判断できなくなっていたのです。

単一の数値に代わる3つのシグナル

私たちは固定のタイムアウト設定を廃止し、以下の3つの手がかりを監視する小さな状態マシンを構築しました。

  • 無音の継続時間 – ユーザーがどのくらいの時間、沈黙しているか。
  • 文法 – 文字起こしが完全な構文単位で終わっているか、あるいは「the」や「and」のような、宙に浮いた単語で終わっているか。
  • 相槌検出 – 直前の音が、本格的な発話(例:回答)なのか、それとも「はい」のような短い相槌なのか。

これらのシグナルを用いて、2つの「無音バジェット(許容範囲)」を定義しました。

  1. 文が完了している場合 – 解析されたテキストが完了しているように見えるときは、550msの短いタイムアウトを適用します。これにより、エージェントはテンポよく、迅速に返答できます。
  2. 文が未完了の場合 – 最後のトークンがユーザーの文の途中であることを示唆している場合は、タイムアウトを1300msまで延長し、話者が話を続けられる余裕を持たせます。

さらに、誤った割り込みを防ぐための2つのガード(保護策)を設けました。

  • 最低発話時間 – 短い「うんうん」などは完全な発話とはみなさず、エージェントは判断を下す前に、より長い発話を待ちます。
  • ハードキャップ(上限設定) – 背景ノイズに関わらず、最大無音制限を設けることで、エージェントが一定時間後に必ず応答するようにし、無限に待ち続けることを防ぎます。

結果とボイスAIへの示唆

この3シグナル・システムを導入した結果、中断率は18%から3%に低下しました。通話者がエージェントに言葉を遮られることはなくなり、以前の「不自然な無音」の問題も解消されました。エージェントは、人間が会話のターンを管理する方法に近い、応答の速さと丁寧さを兼ね備えたものになりました。

ボイスアシスタントを構築する開発者にとって、教訓は明確です。設定ファイル内の単一の定数では、音声による対話のニュアンスを捉えることはできません。無音の長さ、文法の完全性、そして相槌の手がかりを評価する軽量な状態マシンを用いることで、計算負荷を大幅に増やすことなく、発話交代(turn-taking)の精度を劇的に向上させることができます。

潜在的なデメリットと今後の課題

文法解析や相槌の分類を追加することは、処理ステップが増えることを意味します。チームは、追加のレイテンシ(遅延)が会話の滑らかさによるメリットを打ち消さないか検証する必要があります。また、このアプローチはある程度の精度を持つ文字起こしに依存しています。ノイズの多い環境やアクセントの強い話し方では、文法のヒントが機能せず、システムがより長いタイムアウトにフォールバック(退避)せざるを得なくなる可能性があります。

今後の課題としては、個々の通話者の習慣から学習する適応型のタイムアウト閾値の検討や、相槌検出器を強化するためのプロソディ(韻律)的特徴(ピッチ、エネルギー)の統合などが考えられます。これらの改良が、顧客満足度、通話完了時間、エラー率といった主要な指標にどのように影響するかをモニタリングすることが、この手法を大規模なコンタクトセンターへの導入へとスケールさせる上で不可欠となるでしょう。

要点: 発話の完了を単一の無音タイマーではなく、複数のシグナルに基づく判断として扱うことで、割り込みエラーを桁違いに削減し、ユーザーがボイスエージェントに期待する自然な会話の流れを取り戻すことができます。