Чому пошукові ШІ-агенти зазнають невдачі: критична проблема неоднозначності

Поки розробники зосереджуються на покращенні глибини міркувань ШІ-агентів, справжнім вузьким місцем в автономних дослідженнях є не здатність до пошуку, а нездатність працювати з неоднозначністю. Нове дослідження показує, що навіть найсучасніші LLM не можуть зупинитися і попросити роз'яснень, що часто призводить до катастрофічного «каскаду помилок» у довгих ланцюгах міркувань.

Прорив DiscoBench

Дослідники з Tencent Hunyuan та Університету Ціньхуа представили DiscoBench — спеціалізований тестовий фреймворк, розроблений для оцінки того, як мовні моделі справляються з нечіткими, неповними або неправильними запитами користувачів. На відміну від попередніх бенчмарків, таких як GAIA або BrowseComp, які передбачають ідеально сформульовані промпти, DiscoBench моделює хаос реального світу.

Фреймворк складається з 211 завдань у одинадцяти доменах — включаючи науку, політику та музику — що містять 463 конкретні точки неоднозначності. На кожному етапі агент має вирішити, чи продовжувати пошук, чи надати відповідь, чи, що найважливіше, попросити користувача про роз'яснення. Щоб симулювати людську взаємодію, дослідники використали Gemini 3 Flash як симулятор користувача на базі LLM, щоб надавати підказки, коли агент ставить якісне уточнювальне запитання.

Каскад помилок: чому більше пошуку не означає кращий результат

Дослідження виявило небезпечну закономірність: коли агент стикається з неоднозначною сутністю або суперечливим набором критеріїв, він часто обирає стратегію «шукати інтенсивніше», замість того щоб попросити про допомогу. Це призводить до феномену, коли модель виконує чисті, синтаксично правильні пошукові запити, які є фундаментально хибними за напрямком.

Дані показують, що «більше пошуку» може насправді знизити точність. У профілі «SearchHeavyGuess» — де моделі неодноразово шукають, але зрештою лише припускаються, замість того щоб уточнити — рівень успіху впав до 51,9%. Натомість моделі, які використовували стратегію «SearchThenAsk», досягли набагато вищого показника успіху — 93,4%. Це доводить, що проблема полягає не у відсутності пошуку інформації, а у неспроможності до ведення діалогу (conversational agency).

Показники продуктивності провідних моделей

Тестування одинадцяти топових моделей виявило невтішну реальність: навіть лідери галузі ледве долають бар'єр у 50% точності, стикаючись із неоднозначністю.

  • Doubao Seed 2.0 Pro очолила список із 43,1% загальною точністю (end-to-end accuracy).
  • Gemini 3.1 Pro Preview йшла слідом із 40,8%.
  • Claude Opus 4.7 досягла 39,8%, незважаючи на вищий показник проходження етапів (57%).
  • Qwen3.6 Max та MiniMax M2.7 значно відстали з показниками 12,3% та 16,1% відповідно.

Цікаво, що навіть коли дослідники надавали «керований» (Guided) системний промпт, який прямо вказував моделям звертати увагу на неоднозначність, загальна точність зросла лише незначно — з 28,6% до 33,7%. Це свідчить про те, що «виявлення» неоднозначності та «розуміння того, як її розв'язати через взаємодію» — це два різні когнітивні навички.

Наслідки для сфери ШІ

Це дослідження зміщує фокус розробки агентного ШІ. Щоб створити справді надійних автономних дослідників, індустрія має вийти за межі простого збільшення частоти «викликів інструментів» (tool calls) і зосередитися на інтерактивному міркуванні. Наступним рубежем оптимізації LLM є не лише покращення пошуку, а й розробка кращої «логіки уточнення», щоб запобігти накопиченню помилок під час виконання складних багатоетапних завдань.

Основні висновки

  • Неоднозначність — це основна точка відмови: ШІ-агенти зазнають невдачі не тому, що не можуть знайти інформацію, а тому, що не просять роз'яснень, коли запит є недостатньо конкретним.
  • Пастка «інтенсивного пошуку»: Повторний пошук неправильної сутності створює каскад помилок, від якого важче відновитися, ніж у випадку простого припущення.
  • Виявлення $\neq$ Розв'язання: Високі показники виявлення (ідентифікації помилки) не трансформуються автоматично у високий рівень успіху, що підкреслює прогалину в тому, як моделі вирішують проблеми через діалог.