Tác nhân giọng nói (voice-agent) mà chúng tôi sắp ra mắt liên tục ngắt lời người gọi, đẩy tỷ lệ ngắt quãng lên tới 18% và buộc chúng tôi phải viết lại logic kết thúc lượt nói (end-of-turn logic) chỉ mười ngày trước khi ra mắt. Bằng cách bổ sung kiểm tra ngữ pháp và nhận diện tín hiệu phản hồi (back-channel detection) vào quy tắc thời gian chờ im lặng (silence-timeout), chúng tôi đã giảm tỷ lệ ngắt lời xuống còn 3% và loại bỏ những khoảng im lặng kéo dài khiến hệ thống có cảm giác không phản hồi.
Tại sao chỉ một mốc thời gian chờ im lặng là không đủ
Thiết kế ban đầu của chúng tôi coi bất kỳ khoảng tạm dừng nào kéo dài 700 ms là dấu hiệu cho thấy người dùng đã nói xong. Trong một buổi demo được kiểm soát—một người nói các câu đầy đủ trong một căn phòng yên tĩnh—quy tắc đó hoạt động rất tốt. Tuy nhiên, những người gọi thực tế thường tạm dừng để suy nghĩ, chia nhỏ các con số thành từng nhóm, và chèn thêm các từ như “uh-huh” hoặc “mm-hmm” để cho thấy họ đang lắng nghe. Tác nhân đã diễn giải mỗi khoảng tạm dừng đó là kết thúc một lượt nói.
Phân tích 312 cuộc gọi thực tế cho thấy hai vấn đề. Thứ nhất, tác nhân xen vào khi người nói vẫn đang chuẩn bị cho cụm từ tiếp theo, làm hỏng 18% các lượt nói. Thứ hai, khi chúng tôi tăng thời gian chờ lên 1500 ms để ngăn chặn việc ngắt lời, hệ thống trở nên chậm chạp và bắt đầu bị treo trên các đường truyền có nhiều tạp âm. Tiếng ồn nền liên tục đặt lại bộ đếm im lặng, khiến tác nhân không bao giờ xác định được là người dùng đã nói xong.
Ba tín hiệu thay thế cho một con số duy nhất
Chúng tôi đã từ bỏ việc sử dụng một mốc thời gian chờ cố định và xây dựng một máy trạng thái (state machine) nhỏ để theo dõi ba tín hiệu:
- Thời lượng im lặng – người dùng đã giữ im lặng trong bao lâu.
- Ngữ pháp – bản ghi văn bản có kết thúc bằng một đơn vị cú pháp hoàn chỉnh hay là một từ lửng lơ như “the” hoặc “and”?
- Nhận diện tín hiệu phản hồi (back-channel detection) – âm thanh cuối cùng là một lượt nói thực sự (ví dụ: một câu trả lời) hay chỉ là một sự xác nhận ngắn như “yeah”?
Với các tín hiệu này, chúng tôi đã xác định hai mức ngân sách im lặng:
- Bản ghi hoàn chỉnh – khi văn bản được phân tích trông có vẻ đã kết thúc, chúng tôi áp dụng thời gian chờ ngắn là 550 ms. Tác nhân sẽ phản hồi nhanh nhạy và kịp thời.
- Bản ghi lửng lơ – khi token cuối cùng cho thấy người dùng đang nói dở câu, chúng tôi kéo dài thời gian chờ lên 1300 ms, tạo không gian cho người nói tiếp tục.
Hai lớp bảo vệ bổ sung giúp ngăn chặn các lần ngắt lời sai:
- Thời lượng nói tối thiểu – một tiếng “mm-hmm” ngắn không được tính là một lượt nói đầy đủ, vì vậy tác nhân sẽ đợi một phát ngôn dài hơn trước khi quyết định.
- Giới hạn cứng (Hard cap) – bất kể tiếng ồn nền như thế nào, một giới hạn im lặng tối đa sẽ buộc tác nhân phải phản hồi sau một khoảng thời gian hợp lý, tránh tình trạng treo máy vô tận.
Kết quả và ý nghĩa đối với AI giọng nói
Sau khi triển khai hệ thống ba tín hiệu, tỷ lệ ngắt quãng đã giảm từ 18% xuống còn 3%. Người gọi không còn nghe thấy tác nhân nói chèn lên lời họ, và vấn đề “im lặng chết chóc” trước đó đã biến mất. Tác nhân mang lại cảm giác vừa phản hồi nhanh nhạy vừa lịch sự, tương tự như cách con người điều phối các lượt hội thoại.
Đối với các nhà phát triển đang xây dựng trợ lý giọng nói, bài học rất rõ ràng: một hằng số duy nhất trong tệp cấu hình không thể nắm bắt được những sắc thái của tương tác nói. Một máy trạng thái nhẹ nhàng giúp đánh giá độ dài im lặng, tính hoàn chỉnh về ngữ pháp và các tín hiệu phản hồi có thể cải thiện đáng kể độ chính xác khi luân phiên lượt nói mà không làm tăng tải tính toán nặng nề.
Những nhược điểm tiềm ẩn và các câu hỏi mở
Việc bổ sung phân tích cú pháp ngữ pháp và phân loại tín hiệu phản hồi sẽ làm tăng thêm các bước xử lý. Các đội ngũ phải xác minh rằng độ trễ bổ sung không làm mất đi những lợi ích về sự mượt mà trong hội thoại. Cách tiếp cận này cũng dựa trên một bản ghi văn bản tương đối chính xác; trong môi trường ồn ào hoặc với giọng nói có âm hưởng địa phương, các tín hiệu ngữ pháp có thể gặp lỗi, buộc hệ thống phải quay lại sử dụng các mốc thời gian chờ dài hơn.
Công việc trong tương lai có thể khám phá các ngưỡng thời gian chờ thích ứng có khả năng học hỏi từ thói quen của từng người gọi, hoặc tích hợp các đặc điểm ngữ điệu (cao độ, năng lượng) để tăng cường bộ phát hiện tín hiệu phản hồi. Việc giám sát cách những cải tiến này ảnh hưởng đến các chỉ số chính—sự hài lòng của khách hàng, thời gian hoàn thành cuộc gọi và tỷ lệ lỗi—sẽ là điều thiết yếu trước khi mở rộng kỹ thuật này cho các triển khai trung tâm liên lạc lớn hơn.
Bài học rút ra: Việc coi việc hoàn thành lượt nói là một quyết định dựa trên đa tín hiệu, thay vì chỉ dựa vào một bộ đếm thời gian im lặng duy nhất, giúp giảm lỗi ngắt lời xuống nhiều bậc và khôi phục luồng hội thoại tự nhiên mà người dùng mong đợi từ các tác nhân giọng nói.
