一个语音 AI 团队宣布,他们已将真实电话通话的端到端响应延迟降低至 1.8 秒以下——相比其首个原型版本降低了 55%。重叠处理流、神经语音活动检测器、流式文本转语音(TTS)合成以及推测性意图预取技术推动了这一提升,并将预约转化率提高了约 30%。

为什么延迟对语音助手至关重要

长时间的停顿会让拨打者怀疑系统是否仍在聆听。在早期的测试中,原型机在回复前需要等待 2.9 秒。拨打者会重复说话或直接挂断,这清楚地表明延迟破坏了对话的连贯性。对于任何实时服务——无论是客户支持、预订还是信息查询——每一秒的沉默都会削弱信任并降低转化率。

缩短一秒钟的技术优化

该团队放弃了严格的顺序流水线,让每个阶段并行运行,并在获得足够数据后立即向下一阶段进行传输。

  • 神经语音活动检测 (VAD)。 一个小型神经模型监控音频流并预测说话者何时结束句子,从而将检测窗口从约 800 毫秒缩短至 280 毫秒。
  • 流式文本转语音 (TTS)。 系统不再等待完整的文本回答,而是立即将第一句短语流式传输给合成器,因此在生成其余回答的同时,音频就已经开始播放。
  • 推测性意图预取。 在用户说话时,模型会预测可能的意图并提前查询后端。如果预测准确,回答会在话语结束的瞬间准备就绪;如果预测错误,回退方案仍能快速送达。

数据表现及后续关注点

通过重叠设计,总响应时间降至 1.8 秒以下,预约转化率提升了 30%。

这种方法增加了复杂性:并行流和推测性查询会消耗更多的计算资源,并且在预测失败时需要谨慎的错误处理。考虑采取相同路线的团队必须权衡硬件成本与预期的用户参与度提升。