Mengapa Ejen Carian AI Gagal: Masalah Kritikal Kekaburan
Walaupun pembangun menumpukan perhatian pada penambahbaikan kedalaman penaakulan ejen AI, kekangan sebenar dalam penyelidikan autonomi bukanlah keupayaan carian—iaitu ketidakupayaan untuk mengendalikan kekaburan. Satu kajian baharu mendedahkan bahawa walaupun LLM yang paling canggih sukar untuk berhenti seketika dan meminta penjelasan, yang sering membawa kepada "kaskad ralat" (error cascade) yang membawa bencana dalam rantaian penaakulan yang panjang.
Terobosan DiscoBench
Penyelidik dari Tencent Hunyuan dan Universiti Tsinghua telah memperkenalkan DiscoBench, sebuah rangka kerja ujian khusus yang direka untuk menilai bagaimana model bahasa mengendalikan pertanyaan pengguna yang samar, tidak lengkap, atau salah. Tidak seperti penanda aras terdahulu seperti GAIA atau BrowseComp, yang mengandaikan arahan (prompt) yang dibentuk dengan sempurna, DiscoBench mensimulasikan kekacauan dunia sebenar.
Rangka kerja ini terdiri daripada 211 tugasan merentasi sebelas domain—termasuk sains, politik, dan muzik—yang mengandungi 463 titik kekaburan khusus. Pada setiap titik semakan, ejen mesti memutuskan sama ada untuk terus mencari, memberikan jawapan, atau, yang paling penting, meminta penjelasan daripada pengguna. Untuk mensimulasikan interaksi manusia, penyelidik menggunakan Gemini 3 Flash sebagai simulator pengguna berasaskan LLM untuk memberikan petunjuk apabila ejen mengajukan soalan susulan yang berkualiti tinggi.
Kaskad Ralat: Mengapa Lebih Banyak Carian Tidak Bermakna Lebih Baik
Kajian tersebut mengenal pasti satu corak yang berbahaya: apabila ejen menemui entiti yang kabur atau set kriteria yang bercanggah, ia sering memilih untuk "mencari dengan lebih gigih" daripada meminta bantuan. Ini membawa kepada fenomena di mana model melaksanakan carian yang bersih dan betul dari segi sintaksis, tetapi pada dasarnya tersalah arah.
Data menunjukkan bahawa "mencari lebih banyak" sebenarnya boleh mengurangkan ketepatan. Dalam profil "SearchHeavyGuess"—di mana model mencari berulang kali tetapi akhirnya membuat tekaan dan bukannya meminta penjelasan—kadar kejayaan jatuh kepada 51.9%. Sebaliknya, model yang menggunakan strategi "SearchThenAsk" mencapai kadar kejayaan yang jauh lebih tinggi iaitu 93.4%. Ini membuktikan bahawa kegagalan tersebut bukanlah disebabkan oleh kekurangan pengambilan maklumat, tetapi kegagalan dalam agensi perbualan (conversational agency).
Penanda Aras Prestasi Model Terkemuka
Pengujian sebelas model tahap tinggi mendedahkan realiti yang membimbangkan: walaupun peneraju industri bergelut untuk melepasi halangan ketepatan 50% apabila berhadapan dengan kekaburan.
- Doubao Seed 2.0 Pro menerajui kumpulan dengan ketepatan hujung-ke-hujung (end-to-end) sebanyak 43.1%.
- Gemini 3.1 Pro Preview menyusul rapat dengan 40.8%.
- Claude Opus 4.7 mencapai 39.8%, walaupun mempunyai kadar kelulusan titik semakan yang lebih tinggi (57%).
- Qwen3.6 Max dan MiniMax M2.7 ketinggalan jauh masing-masing pada 12.3% dan 16.1%.
Menariknya, walaupun penyelidik menyediakan arahan sistem (system prompt) "Guided" yang memberitahu model secara eksplisit untuk berwaspada terhadap kekaburan, ketepatan hujung-ke-hujung hanya meningkat sedikit daripada 28.6% kepada 33.7%. Ini menunjukkan bahawa "mengesan" kekaburan dan "mengetahui cara menyelesaikannya melalui interaksi" adalah dua kemahiran kognitif yang berbeza.
Implikasi terhadap Landskap AI
Penyelidikan ini mengubah fokus pembangunan AI ejen (agentic AI). Untuk membina penyelidik autonomi yang benar-benar boleh dipercayai, industri mesti melangkaui sekadar meningkatkan kekerapan "panggilan alatan" (tool call) dan menumpukan kepada penaakulan interaktif. Sempadan seterusnya untuk pengoptimuman LLM bukan sekadar pengambilan maklumat yang lebih baik—iaitu pembangunan "logik penjelasan" yang lebih baik untuk mengelakkan ralat daripada bertambah parah semasa tugasan pelbagai langkah yang kompleks.
Ringkasan Utama
- Kekaburan adalah titik kegagalan utama: Ejen AI gagal bukan kerana mereka tidak dapat mencari maklumat, tetapi kerana mereka gagal meminta penjelasan apabila sesuatu pertanyaan tidak dinyatakan dengan jelas.
- Perangkap "Search-Heavy": Mencari entiti yang salah secara berulang kali mewujudkan kaskad ralat yang lebih sukar untuk dipulihkan berbanding sekadar membuat tekaan.
- Pengesanan $\neq$ Penyelesaian: Skor pengesanan yang tinggi (mengenal pasti ralat) tidak secara automatik diterjemahkan kepada kadar kejayaan yang tinggi, sekali gus menonjolkan jurang dalam cara model mengendalikan penyelesaian masalah secara perbualan.
