چرا عاملهای جستجوی هوش مصنوعی شکست میخورند: مشکل حیاتی ابهام
در حالی که توسعهدهندگان بر بهبود عمق استدلال عاملهای هوش مصنوعی تمرکز کردهاند، گلوگاه واقعی در تحقیقات خودگردان، قابلیت جستجو نیست، بلکه ناتوانی در مدیریت ابهام است. مطالعهای جدید نشان میدهد که حتی پیشرفتهترین مدلهای زبانی بزرگ (LLMs) برای توقف و درخواست شفافسازی دچار مشکل هستند، که این امر اغلب منجر به یک «آبشار خطا» (error cascade) فاجعهبار در زنجیرههای استدلال طولانی میشود.
پیشرفت DiscoBench
محققان Tencent Hunyuan و دانشگاه Tsinghua، چارچوب تست تخصصی DiscoBench را معرفی کردهاند که برای ارزیابی نحوه برخورد مدلهای زبانی با پرسوجوهای مبهم، ناقص یا نادرست کاربران طراحی شده است. برخلاف بنچمارکهای قبلی مانند GAIA یا BrowseComp که فرض را بر پرامپتهای کاملاً دقیق میگذارند، DiscoBench آشفتگیهای دنیای واقعی را شبیهسازی میکند.
این چارچوب شامل ۲۱۱ وظیفه در یازده حوزه مختلف — از جمله علوم، سیاست و موسیقی — است که حاوی ۴۶۳ نقطه ابهام مشخص میباشد. در هر نقطه بازرسی، یک عامل باید تصمیم بگیرد که آیا به جستجو ادامه دهد، پاسخی ارائه دهد یا از همه مهمتر، از کاربر درخواست شفافسازی کند. برای شبیهسازی تعامل انسانی، محققان از Gemini 3 Flash به عنوان یک شبیهساز کاربر مبتنی بر LLM استفاده کردند تا زمانی که یک عامل سوال پیگیری باکیفیتی میپرسد، سرنخهایی ارائه دهد.
آبشار خطا: چرا جستجوی بیشتر لزوماً بهتر نیست
این مطالعه یک الگوی خطرناک را شناسایی کرده است: وقتی یک عامل با یک موجودیت مبهم یا مجموعهای از معیارهای متناقض روبرو میشود، اغلب به جای درخواست کمک، گزینه «جستجوی سختتر» را انتخاب میکند. این امر منجر به پدیدهای میشود که در آن مدل، جستجوهای تمیز و از نظر نحو (syntax) صحیح را اجرا میکند، اما این جستجوها اساساً به مسیر اشتباه هدایت شدهاند.
دادهها نشان میدهند که «جستجوی بیشتر» در واقع میتواند دقت را کاهش دهد. در پروفایل "SearchHeavyGuess" — جایی که مدلها مکرراً جستجو میکنند اما در نهایت به جای شفافسازی، حدس میزنند — نرخ موفقیت به ۵۱.۹٪ کاهش یافت. در مقابل، مدلهایی که از استراتژی "SearchThenAsk" استفاده کردند، به نرخ موفقیت بسیار بالاتر ۹۳.۴٪ دست یافتند. این ثابت میکند که شکست ناشی از کمبود بازیابی اطلاعات نیست، بلکه ناشی از شکست در «عاملیت گفتگویی» (conversational agency) است.
بنچمارک عملکرد مدلهای پیشرو
آزمایش یازده مدل سطح بالا، واقعیت تلخی را آشکار کرد: حتی رهبران این صنعت نیز هنگام مواجهه با ابهام، برای عبور از سد ۵۰٪ دقت با مشکل روبرو هستند.
- Doubao Seed 2.0 Pro با ۴۳.۱٪ دقت سرتاسری (end-to-end) در صدر قرار گرفت.
- Gemini 3.1 Pro Preview با ۴۰.۸٪ در جایگاه دوم قرار گرفت.
- Claude Opus 4.7 با وجود داشتن نرخ عبور از نقاط بازرسی بالاتر (۵۷٪)، به ۳۹.۸٪ رسید.
- Qwen3.6 Max و MiniMax M2.7 به ترتیب با ۱۲.۳٪ و ۱۶.۱٪ عقب ماندند.
جالب اینجاست که حتی زمانی که محققان یک پرامپت سیستم «هدایتشده» (Guided) ارائه کردند که صراحتاً به مدلها میگفت مراقب ابهام باشند، دقت سرتاسری تنها از ۲۸.۶٪ به ۳۳.۷٪ افزایش یافت. این نشان میدهد که «تشخیص» ابهام و «دانستن نحوه حل آن از طریق تعامل»، دو مهارت شناختی متمایز هستند.
پیامدها برای چشمانداز هوش مصنوعی
این تحقیق تمرکز توسعه هوش مصنوعی عاملیتمحور (agentic AI) را تغییر میدهد. برای ساخت محققان خودگردان واقعاً قابل اعتماد، صنعت باید از افزایش فرکانس «فراخوانی ابزار» (tool call) فراتر رفته و بر استدلال تعاملی تمرکز کند. مرز بعدی برای بهینهسازی LLMها تنها بازیابی بهتر نیست، بلکه توسعه «منطق شفافسازی» بهتر برای جلوگیری از انباشته شدن خطاها در طول وظایف پیچیده و چندمرحلهای است.
نکات کلیدی
- ابهام نقطه اصلی شکست است: عاملهای هوش مصنوعی نه به این دلیل که نمیتوانند اطلاعات را پیدا کنند، بلکه به این دلیل شکست میخورند که وقتی یک پرسوجو ناقص است، از درخواست شفافسازی خودداری میکنند.
- تله «جستجوی سنگین»: جستجوی مکرر برای یک موجودیت اشتباه، باعث ایجاد یک آبشار خطا میشود که بازیابی از آن دشوارتر از یک حدس ساده است.
- تشخیص $\neq$ حل مسئله: امتیازات بالای تشخیص (شناسایی خطا) به طور خودکار به نرخ موفقیت بالا تبدیل نمیشوند، که این امر نشاندهنده شکافی در نحوه مدیریت حل مسئله گفتگویی توسط مدلها است.
