Почему ИИ-агенты поиска терпят неудачу: критическая проблема неоднозначности

Пока разработчики сосредоточены на углублении логического мышления ИИ-агентов, реальным узким местом в автономных исследованиях является не способность к поиску, а неумение работать с неоднозначностью. Новое исследование показывает, что даже самые продвинутые LLM с трудом могут сделать паузу и запросить уточнение, что часто приводит к катастрофическому «каскаду ошибок» в длинных цепочках рассуждений.

Прорыв DiscoBench

Исследователи из Tencent Hunyuan и Университета Цинхуа представили DiscoBench — специализированную тестовую платформу, предназначенную для оценки того, как языковые модели справляются с расплывчатыми, неполными или некорректными запросами пользователей. В отличие от предыдущих бенчмарков, таких как GAIA или BrowseComp, которые предполагают идеально сформулированные промпты, DiscoBench имитирует хаос реального мира.

Платформа состоит из 211 задач в одиннадцати областях — включая науку, политику и музыку — и содержит 463 конкретные точки неоднозначности. На каждом контрольном этапе агент должен решить, продолжать ли поиск, предоставить ответ или, что самое важное, попросить пользователя об уточнении. Чтобы имитировать взаимодействие с человеком, исследователи использовали Gemini 3 Flash в качестве симулятора пользователя на базе LLM, который предоставляет подсказки, когда агент задает качественный уточняющий вопрос.

Каскад ошибок: почему «больше поиска» не значит «лучше»

Исследование выявило опасную закономерность: когда агент сталкивается с неоднозначным объектом или противоречивым набором критериев, он часто предпочитает «искать усерднее», а не просить о помощи. Это приводит к феномену, при котором модель выполняет чистые, синтаксически правильные поисковые запросы, которые в корне неверно направлены.

Данные показывают, что «усиление поиска» может на самом деле снизить точность. В профиле «SearchHeavyGuess» — где модели многократно ищут, но в итоге гадают вместо того, чтобы уточнить детали — показатели успеха упали до 51,9%. Напротив, модели, использовавшие стратегию «SearchThenAsk», достигли гораздо более высокого показателя успеха — 93,4%. Это доказывает, что проблема заключается не в нехватке поиска информации, а в отсутствии навыков ведения диалога (conversational agency).

Показатели производительности ведущих моделей

Тестирование одиннадцати топовых моделей выявило отрезвляющую реальность: даже лидеры индустрии с трудом преодолевают барьер в 50% точности при столкновении с неоднозначностью.

  • Doubao Seed 2.0 Pro лидировала с точностью 43,1% (end-to-end).
  • Gemini 3.1 Pro Preview следовала за ней с результатом 40,8%.
  • Claude Opus 4.7 достигла 39,8%, несмотря на более высокий процент прохождения контрольных точек (57%).
  • Qwen3.6 Max и MiniMax M2.7 значительно отставали с показателями 12,3% и 16,1% соответственно.

Интересно, что даже когда исследователи использовали «направляющий» (Guided) системный промпт, явно указывающий моделям следить за неоднозначностью, сквозная точность (end-to-end) выросла лишь незначительно — с 28,6% до 33,7%. Это говорит о том, что «обнаружение» неоднозначности и «понимание того, как разрешить её через взаимодействие» — это два разных когнитивных навыка.

Последствия для ландшафта ИИ

Это исследование смещает фокус разработки агентного ИИ. Чтобы создавать по-настоящему надежных автономных исследователей, индустрия должна выйти за рамки простого увеличения частоты «вызовов инструментов» (tool calls) и сосредоточиться на интерактивном рассуждении. Следующим рубежом оптимизации LLM станет не просто улучшение поиска, а разработка более совершенной «логики уточнения», чтобы предотвратить накопление ошибок при выполнении сложных многоэтапных задач.

Ключевые выводы

  • Неоднозначность — основная точка отказа: ИИ-агенты терпят неудачу не потому, что не могут найти информацию, а потому, что не могут запросить уточнение, когда запрос сформулирован недостаточно четко.
  • Ловушка «интенсивного поиска» (Search-Heavy): Многократный поиск неверного объекта создает каскад ошибок, из которого гораздо сложнее выбраться, чем в случае простого угадывания.
  • Обнаружение $\neq$ Разрешение: Высокие показатели обнаружения (идентификации ошибки) не трансформируются автоматически в высокий уровень успеха, что подчеркивает разрыв в том, как модели справляются с решением задач в процессе диалога.