ある音声AIチームが、実際の電話通話におけるエンドツーエンドの応答レイテンシを1.8秒未満に短縮したと発表しました。これは最初のプロトタイプから55%の削減となります。処理ストリームのオーバーラップ、ニューラル音声活動検知(VAD)、ストリーミング音声合成(TTS)、そして投機的な意図のプリフェッチ(speculative intent pre-fetching)がこの成果をもたらし、予約コンバージョン率を約30%向上させました。
音声アシスタントにとってレイテンシが重要な理由
長い沈黙は、通話者に「システムがまだ聞き取っているのか?」という不安を与えます。初期テストのプロトタイプでは、応答までに2.9秒の待ち時間がありました。通話者は同じことを繰り返したり、電話を切ったりしてしまい、レイテンシが会話の流れを阻害していることは明らかでした。カスタマーサポート、予約、情報検索など、あらゆるリアルタイムサービスにおいて、わずか1秒の沈黙が信頼を損ない、コンバージョンを低下させます。
1秒を短縮した技術的な調整
チームは厳密な逐次型パイプラインを廃止し、各ステージを並列に実行させ、十分なデータが揃い次第すぐに次のステージへ渡す仕組みを導入しました。
- ニューラル音声活動検知 (VAD)。 小規模なニューラルモデルがオーディオストリームを監視し、話者がいつ文章を終えるかを予測することで、検知ウィンドウを約800msから280msへと短縮しました。
- ストリーミング音声合成 (TTS)。 テキストによる回答がすべて完成するのを待つのではなく、システムが最初のフレーズを即座にシンセサイザーにストリーミングするため、回答の残りの部分が生成されている間に音声再生を開始できます。
- 投機的な意図のプリフェッチ。 ユーザーが話している間に、モデルが起こりうる意図を予測してバックエンドに事前クエリを送信します。予測が当たれば、発話が終わった瞬間に回答の準備が整います。予測が外れた場合でも、フォールバック(代替処理)が迅速に行われます。
数値が示す結果と今後の注目点
このオーバーラップ設計により、総応答時間は1.8秒未満に低下し、予約コンバージョン率は30%上昇しました。
ただし、このアプローチは複雑さも増大させます。並列ストリームと投機的なクエリは、より多くの計算リソースを消費し、予測が外れた場合には慎重なエラーハンドリングが求められます。同様の手法を検討しているチームは、ハードウェアコストと、期待されるユーザーエンゲージメントの向上とのバランスを慎重に検討する必要があります。
