چرا عامل‌های جستجوی هوش مصنوعی شکست می‌خورند: مشکل حیاتی ابهام

در حالی که توسعه‌دهندگان بر بهبود عمق استدلال عامل‌های هوش مصنوعی تمرکز کرده‌اند، گلوگاه واقعی در تحقیقات خودگردان، قابلیت جستجو نیست، بلکه ناتوانی در مدیریت ابهام است. مطالعه‌ای جدید نشان می‌دهد که حتی پیشرفته‌ترین مدل‌های زبانی بزرگ (LLMs) برای توقف و درخواست شفاف‌سازی دچار مشکل هستند، که این امر اغلب منجر به یک «آبشار خطا» (error cascade) فاجعه‌بار در زنجیره‌های استدلال طولانی می‌شود.

پیشرفت DiscoBench

محققان Tencent Hunyuan و دانشگاه Tsinghua، چارچوب تست تخصصی DiscoBench را معرفی کرده‌اند که برای ارزیابی نحوه برخورد مدل‌های زبانی با پرس‌وجوهای مبهم، ناقص یا نادرست کاربران طراحی شده است. برخلاف بنچمارک‌های قبلی مانند GAIA یا BrowseComp که فرض را بر پرامپت‌های کاملاً دقیق می‌گذارند، DiscoBench آشفتگی‌های دنیای واقعی را شبیه‌سازی می‌کند.

این چارچوب شامل ۲۱۱ وظیفه در یازده حوزه مختلف — از جمله علوم، سیاست و موسیقی — است که حاوی ۴۶۳ نقطه ابهام مشخص می‌باشد. در هر نقطه بازرسی، یک عامل باید تصمیم بگیرد که آیا به جستجو ادامه دهد، پاسخی ارائه دهد یا از همه مهم‌تر، از کاربر درخواست شفاف‌سازی کند. برای شبیه‌سازی تعامل انسانی، محققان از Gemini 3 Flash به عنوان یک شبیه‌ساز کاربر مبتنی بر LLM استفاده کردند تا زمانی که یک عامل سوال پیگیری باکیفیتی می‌پرسد، سرنخ‌هایی ارائه دهد.

آبشار خطا: چرا جستجوی بیشتر لزوماً بهتر نیست

این مطالعه یک الگوی خطرناک را شناسایی کرده است: وقتی یک عامل با یک موجودیت مبهم یا مجموعه‌ای از معیارهای متناقض روبرو می‌شود، اغلب به جای درخواست کمک، گزینه «جستجوی سخت‌تر» را انتخاب می‌کند. این امر منجر به پدیده‌ای می‌شود که در آن مدل، جستجوهای تمیز و از نظر نحو (syntax) صحیح را اجرا می‌کند، اما این جستجوها اساساً به مسیر اشتباه هدایت شده‌اند.

داده‌ها نشان می‌دهند که «جستجوی بیشتر» در واقع می‌تواند دقت را کاهش دهد. در پروفایل "SearchHeavyGuess" — جایی که مدل‌ها مکرراً جستجو می‌کنند اما در نهایت به جای شفاف‌سازی، حدس می‌زنند — نرخ موفقیت به ۵۱.۹٪ کاهش یافت. در مقابل، مدل‌هایی که از استراتژی "SearchThenAsk" استفاده کردند، به نرخ موفقیت بسیار بالاتر ۹۳.۴٪ دست یافتند. این ثابت می‌کند که شکست ناشی از کمبود بازیابی اطلاعات نیست، بلکه ناشی از شکست در «عاملیت گفتگویی» (conversational agency) است.

بنچمارک عملکرد مدل‌های پیشرو

آزمایش یازده مدل سطح بالا، واقعیت تلخی را آشکار کرد: حتی رهبران این صنعت نیز هنگام مواجهه با ابهام، برای عبور از سد ۵۰٪ دقت با مشکل روبرو هستند.

  • Doubao Seed 2.0 Pro با ۴۳.۱٪ دقت سرتاسری (end-to-end) در صدر قرار گرفت.
  • Gemini 3.1 Pro Preview با ۴۰.۸٪ در جایگاه دوم قرار گرفت.
  • Claude Opus 4.7 با وجود داشتن نرخ عبور از نقاط بازرسی بالاتر (۵۷٪)، به ۳۹.۸٪ رسید.
  • Qwen3.6 Max و MiniMax M2.7 به ترتیب با ۱۲.۳٪ و ۱۶.۱٪ عقب ماندند.

جالب اینجاست که حتی زمانی که محققان یک پرامپت سیستم «هدایت‌شده» (Guided) ارائه کردند که صراحتاً به مدل‌ها می‌گفت مراقب ابهام باشند، دقت سرتاسری تنها از ۲۸.۶٪ به ۳۳.۷٪ افزایش یافت. این نشان می‌دهد که «تشخیص» ابهام و «دانستن نحوه حل آن از طریق تعامل»، دو مهارت شناختی متمایز هستند.

پیامدها برای چشم‌انداز هوش مصنوعی

این تحقیق تمرکز توسعه هوش مصنوعی عاملیت‌محور (agentic AI) را تغییر می‌دهد. برای ساخت محققان خودگردان واقعاً قابل اعتماد، صنعت باید از افزایش فرکانس «فراخوانی ابزار» (tool call) فراتر رفته و بر استدلال تعاملی تمرکز کند. مرز بعدی برای بهینه‌سازی LLMها تنها بازیابی بهتر نیست، بلکه توسعه «منطق شفاف‌سازی» بهتر برای جلوگیری از انباشته شدن خطاها در طول وظایف پیچیده و چندمرحله‌ای است.

نکات کلیدی

  • ابهام نقطه اصلی شکست است: عامل‌های هوش مصنوعی نه به این دلیل که نمی‌توانند اطلاعات را پیدا کنند، بلکه به این دلیل شکست می‌خورند که وقتی یک پرس‌وجو ناقص است، از درخواست شفاف‌سازی خودداری می‌کنند.
  • تله «جستجوی سنگین»: جستجوی مکرر برای یک موجودیت اشتباه، باعث ایجاد یک آبشار خطا می‌شود که بازیابی از آن دشوارتر از یک حدس ساده است.
  • تشخیص $\neq$ حل مسئله: امتیازات بالای تشخیص (شناسایی خطا) به طور خودکار به نرخ موفقیت بالا تبدیل نمی‌شوند، که این امر نشان‌دهنده شکافی در نحوه مدیریت حل مسئله گفتگویی توسط مدل‌ها است.