Một đội ngũ AI giọng nói vừa thông báo rằng họ đã đẩy độ trễ phản hồi đầu-cuối trong các cuộc gọi điện thoại thực tế xuống dưới 1,8 giây—giảm 55% so với nguyên mẫu đầu tiên. Các luồng xử lý chồng lấp, bộ phát hiện hoạt động giọng nói bằng mạng thần kinh, tổng hợp văn bản thành giọng nói dạng streaming và truy xuất trước ý định mang tính suy đoán đã thúc đẩy sự cải thiện này, đồng thời nâng tỷ lệ chuyển đổi đặt lịch hẹn lên khoảng 30%.

Tại sao độ trễ lại quan trọng đối với các trợ lý giọng nói

Những khoảng dừng dài khiến người gọi tự hỏi liệu hệ thống có còn đang lắng nghe hay không. Trong các thử nghiệm ban đầu, nguyên mẫu đã mất 2,9 giây trước khi phản hồi. Người gọi thường phải lặp lại lời nói hoặc cúp máy, một dấu hiệu rõ ràng cho thấy độ trễ đang phá vỡ luồng hội thoại. Đối với bất kỳ dịch vụ thời gian thực nào—hỗ trợ khách hàng, đặt chỗ, tra cứu thông tin—mỗi giây im lặng đều làm xói mòn niềm tin và giảm tỷ lệ chuyển đổi.

Những tinh chỉnh kỹ thuật giúp cắt giảm một giây

Đội ngũ đã từ bỏ quy trình tuần tự nghiêm ngặt và cho phép mỗi giai đoạn chạy song song, cung cấp dữ liệu cho giai đoạn tiếp theo ngay khi có đủ dữ liệu.

  • Phát hiện hoạt động giọng nói bằng mạng thần kinh (VAD). Một mô hình mạng thần kinh nhỏ theo dõi luồng âm thanh và dự đoán khi nào người nói kết thúc một câu, giúp cắt giảm cửa sổ phát hiện từ khoảng 800 ms xuống còn 280 ms.
  • Tổng hợp văn bản thành giọng nói (TTS) dạng streaming. Thay vì chờ đợi toàn bộ câu trả lời bằng văn bản, hệ thống sẽ truyền ngay cụm từ đầu tiên đến bộ tổng hợp, nhờ đó âm thanh bắt đầu phát trong khi phần còn lại của câu trả lời vẫn đang được tạo ra.
  • Truy xuất trước ý định mang tính suy đoán. Trong khi người dùng vẫn đang nói, mô hình sẽ dự đoán ý định có khả năng xảy ra và truy vấn backend trước. Nếu dự đoán đúng, câu trả lời sẽ sẵn sàng ngay khi câu nói kết thúc; nếu sai, phương án dự phòng vẫn sẽ được phản hồi nhanh chóng.

Những con số cho thấy điều gì và cần lưu ý gì tiếp theo

Với thiết kế chồng lấp, tổng thời gian phản hồi đã giảm xuống dưới 1,8 giây và tỷ lệ chuyển đổi đặt lịch hẹn tăng 30%.

Cách tiếp cận này làm tăng độ phức tạp: các luồng song song và các truy vấn mang tính suy đoán tiêu tốn nhiều tài nguyên tính toán hơn và đòi hỏi việc xử lý lỗi cẩn thận khi các dự đoán bị sai. Các đội ngũ đang hướng tới lộ trình tương tự phải cân nhắc giữa chi phí phần cứng và mức độ tăng trưởng kỳ vọng trong sự tương tác của người dùng.