Mengapa Agen Pencarian AI Gagal: Masalah Kritis Ambiguitas

Sementara para pengembang fokus pada peningkatan kedalaman penalaran agen AI, hambatan nyata dalam riset otonom bukanlah kemampuan pencarian—melainkan ketidakmampuan untuk menangani ambiguitas. Sebuah studi baru mengungkapkan bahwa bahkan LLM yang paling canggih sekalipun kesulitan untuk berhenti sejenak dan meminta klarifikasi, yang sering kali menyebabkan "kaskade kesalahan" (error cascade) yang fatal dalam rantai penalaran yang panjang.

Terobosan DiscoBench

Peneliti dari Tencent Hunyuan dan Universitas Tsinghua telah memperkenalkan DiscoBench, sebuah kerangka pengujian khusus yang dirancang untuk mengevaluasi bagaimana model bahasa menangani kueri pengguna yang samar, tidak lengkap, atau salah. Berbeda dengan tolok ukur sebelumnya seperti GAIA atau BrowseComp, yang mengasumsikan perintah (prompt) yang terbentuk sempurna, DiscoBench mensimulasikan kekacauan dunia nyata.

Kerangka kerja ini terdiri dari 211 tugas di sebelas domain—termasuk sains, politik, dan musik—yang mengandung 463 titik ambiguitas spesifik. Pada setiap titik pemeriksaan (checkpoint), seorang agen harus memutuskan apakah akan terus mencari, memberikan jawaban, atau, yang paling penting, meminta klarifikasi kepada pengguna. Untuk mensimulasikan interaksi manusia, para peneliti menggunakan Gemini 3 Flash sebagai simulator pengguna berbasis LLM untuk memberikan petunjuk ketika agen mengajukan pertanyaan lanjutan yang berkualitas tinggi.

Kaskade Kesalahan: Mengapa Mencari Lebih Banyak Tidak Selalu Lebih Baik

Studi ini mengidentifikasi pola yang berbahaya: ketika seorang agen menemukan entitas yang ambigu atau sekumpulan kriteria yang bertentangan, ia sering kali memilih untuk "mencari lebih keras" daripada meminta bantuan. Hal ini menyebabkan fenomena di mana model melakukan pencarian yang bersih dan secara sintaksis benar, namun pada dasarnya salah arah.

Data menunjukkan bahwa "mencari lebih banyak" sebenarnya dapat menurunkan akurasi. Dalam profil "SearchHeavyGuess"—di mana model berulang kali mencari tetapi akhirnya menebak alih-alih mengklarifikasi—tingkat keberhasilan turun menjadi 51,9%. Sebaliknya, model yang menggunakan strategi "SearchThenAsk" mencapai tingkat keberhasilan yang jauh lebih tinggi, yaitu 93,4%. Ini membuktikan bahwa kegagalan tersebut bukan karena kurangnya pengambilan informasi, melainkan kegagalan dalam agensi percakapan (conversational agency).

Tolok Ukur Performa Model Terkemuka

Pengujian terhadap sebelas model kelas atas mengungkapkan kenyataan yang pahit: bahkan pemimpin industri pun kesulitan menembus penghalang akurasi 50% saat menghadapi ambiguitas.

  • Doubao Seed 2.0 Pro memimpin dengan akurasi end-to-end sebesar 43,1%.
  • Gemini 3.1 Pro Preview menyusul ketat di angka 40,8%.
  • Claude Opus 4.7 mencapai 39,8%, meskipun memiliki tingkat kelulusan checkpoint yang lebih tinggi (57%).
  • Qwen3.6 Max dan MiniMax M2.7 tertinggal jauh masing-masing pada 12,3% dan 16,1%.

Menariknya, bahkan ketika peneliti memberikan perintah sistem "Guided" yang secara eksplisit memberi tahu model untuk mewaspadai ambiguitas, akurasi end-to-end hanya naik sedikit dari 28,6% menjadi 33,7%. Hal ini menunjukkan bahwa "mendeteksi" ambiguitas dan "mengetahui cara menyelesaikannya melalui interaksi" adalah dua keterampilan kognitif yang berbeda.

Implikasi bagi Lanskap AI

Penelitian ini menggeser fokus pengembangan AI agen (agentic AI). Untuk membangun peneliti otonom yang benar-benar andal, industri harus melampaui sekadar meningkatkan frekuensi "pemanggilan alat" (tool call) dan fokus pada penalaran interaktif. Batas berikutnya untuk optimalisasi LLM bukan sekadar pengambilan informasi yang lebih baik—melainkan pengembangan "logika klarifikasi" yang lebih baik untuk mencegah kesalahan menumpuk selama tugas-tugas kompleks yang melibatkan banyak langkah.

Poin Penting

  • Ambiguitas adalah titik kegagalan utama: Agen AI gagal bukan karena mereka tidak dapat menemukan informasi, tetapi karena mereka gagal meminta klarifikasi ketika sebuah kueri tidak spesifik.
  • Jebakan "Search-Heavy": Mencari entitas yang salah secara berulang kali menciptakan kaskade kesalahan yang lebih sulit dipulihkan daripada sekadar menebak.
  • Deteksi $\neq$ Resolusi: Skor deteksi yang tinggi (mengidentifikasi kesalahan) tidak secara otomatis diterjemahkan ke tingkat keberhasilan yang tinggi, menyoroti adanya celah dalam cara model menangani pemecahan masalah secara percakapan.