Tại sao các Agent tìm kiếm AI thất bại: Vấn đề cốt lõi về sự mơ hồ
Trong khi các nhà phát triển tập trung vào việc cải thiện chiều sâu suy luận của các agent AI, nút thắt thực sự trong nghiên cứu tự trị không nằm ở khả năng tìm kiếm—mà là khả năng xử lý sự mơ hồ. Một nghiên cứu mới tiết lộ rằng ngay cả các LLM tiên tiến nhất cũng gặp khó khăn trong việc tạm dừng và yêu cầu làm rõ, thường dẫn đến một "chuỗi lỗi thảm khốc" (error cascade) trong các chuỗi suy luận dài.
Bước đột phá từ DiscoBench
Các nhà nghiên cứu từ Tencent Hunyuan và Đại học Thanh Hoa đã giới thiệu DiscoBench, một khung thử nghiệm chuyên dụng được thiết kế để đánh giá cách các mô hình ngôn ngữ xử lý các truy vấn người dùng mơ hồ, không đầy đủ hoặc không chính xác. Khác với các tiêu chuẩn đánh giá (benchmark) trước đây như GAIA hay BrowseComp vốn giả định các câu lệnh (prompt) được soạn thảo hoàn hảo, DiscoBench mô phỏng sự hỗn loạn của thế giới thực.
Khung thử nghiệm này bao gồm 211 tác vụ thuộc mười một lĩnh vực—bao gồm khoa học, chính trị và âm nhạc—chứa 463 điểm mơ hồ cụ thể. Tại mỗi điểm kiểm tra, một agent phải quyết định xem nên tiếp tục tìm kiếm, đưa ra câu trả lời, hay quan trọng nhất là yêu cầu người dùng làm rõ. Để mô phỏng sự tương tác của con người, các nhà nghiên cứu đã sử dụng Gemini 3 Flash như một trình mô phỏng người dùng dựa trên LLM để cung cấp các manh mối khi agent đặt một câu hỏi tiếp nối chất lượng cao.
Chuỗi lỗi (Error Cascade): Tại sao tìm kiếm nhiều hơn không có nghĩa là tốt hơn
Nghiên cứu xác định một mô hình nguy hiểm: khi một agent gặp phải một thực thể mơ hồ hoặc một tập hợp các tiêu chí mâu thuẫn, nó thường chọn cách "tìm kiếm quyết liệt hơn" thay vì yêu cầu trợ giúp. Điều này dẫn đến một hiện tượng mà mô hình thực hiện các tìm kiếm sạch sẽ, đúng cú pháp nhưng về cơ bản lại đi sai hướng.
Dữ liệu cho thấy việc "tìm kiếm nhiều hơn" thực tế có thể làm giảm độ chính xác. Trong hồ sơ "SearchHeavyGuess"—nơi các mô hình tìm kiếm lặp đi lặp lại nhưng cuối cùng lại đoán thay vì làm rõ—tỷ lệ thành công đã giảm xuống còn 51,9%. Ngược lại, các mô hình sử dụng chiến lược "SearchThenAsk" đã đạt được tỷ lệ thành công cao hơn nhiều, ở mức 93,4%. Điều này chứng minh rằng thất bại không nằm ở việc thiếu khả năng truy xuất thông tin, mà là sự thất bại trong khả năng tương tác hội thoại (conversational agency).
Điểm chuẩn hiệu suất của các mô hình hàng đầu
Việc thử nghiệm mười một mô hình hàng đầu đã tiết lộ một thực tế đáng lo ngại: ngay cả những cái tên dẫn đầu ngành cũng gặp khó khăn trong việc vượt qua rào cản độ chính xác 50% khi đối mặt với sự mơ hồ.
- Doubao Seed 2.0 Pro dẫn đầu với độ chính xác đầu-cuối (end-to-end) là 43,1%.
- Gemini 3.1 Pro Preview bám sát ở mức 40,8%.
- Claude Opus 4.7 đạt 39,8%, mặc dù có tỷ lệ vượt qua điểm kiểm tra cao hơn (57%).
- Qwen3.6 Max và MiniMax M2.7 tụt lại đáng kể với tỷ lệ lần lượt là 12,3% và 16,1%.
Thú vị là, ngay cả khi các nhà nghiên cứu cung cấp một câu lệnh hệ thống "Guided" (có hướng dẫn) để yêu cầu mô hình chú ý đến sự mơ hồ, độ chính xác đầu-cuối cũng chỉ tăng nhẹ từ 28,6% lên 33,7%. Điều này cho thấy "phát hiện" sự mơ hồ và "biết cách giải quyết nó thông qua tương tác" là hai kỹ năng nhận thức riêng biệt.
Hệ quả đối với bối cảnh AI
Nghiên cứu này chuyển dịch trọng tâm của việc phát triển AI dạng agent (agentic AI). Để xây dựng các nhà nghiên cứu tự trị thực sự đáng tin cậy, ngành công nghiệp phải vượt ra ngoài việc tăng tần suất "gọi công cụ" (tool call) và tập trung vào suy luận tương tác (interactive reasoning). Ranh giới tiếp theo cho việc tối ưu hóa LLM không chỉ là truy xuất tốt hơn—mà là phát triển "logic làm rõ" (clarification logic) tốt hơn để ngăn chặn các lỗi tích tụ trong các tác vụ phức tạp, nhiều bước.
Các điểm chính cần lưu ý
- Sự mơ hồ là điểm thất bại chính: Các agent AI thất bại không phải vì chúng không thể tìm thấy thông tin, mà vì chúng không yêu cầu làm rõ khi một truy vấn chưa được xác định rõ ràng.
- Cạm bẫy "Tìm kiếm quá mức" (Search-Heavy): Việc liên tục tìm kiếm sai thực thể sẽ tạo ra một chuỗi lỗi, khiến việc khắc phục trở nên khó khăn hơn so với việc chỉ đơn thuần là đoán.
- Phát hiện $\neq$ Giải quyết: Điểm phát hiện cao (nhận diện được lỗi) không tự động chuyển hóa thành tỷ lệ thành công cao, làm nổi bật khoảng cách trong cách các mô hình xử lý việc giải quyết vấn đề thông qua hội thoại.
