Dlaczego agenci wyszukiwania AI zawodzą: Krytyczny problem niejednoznaczności
Podczas gdy programiści skupiają się na poprawie głębi rozumowania agentów AI, prawdziwym wąskim gardłem w autonomicznych badaniach nie jest zdolność wyszukiwania, lecz niezdolność do radzenia sobie z niejednoznacznością. Nowe badanie ujawnia, że nawet najbardziej zaawansowane modele LLM mają trudności z zatrzymaniem się i poproszeniem o wyjaśnienie, co często prowadzi do katastrofalnej „kaskady błędów” w długich łańcuchach rozumowania.
Przełom DiscoBench
Badacze z Tencent Hunyuan i Tsinghua University wprowadzili DiscoBench – specjalistyczne ramy testowe zaprojektowane w celu oceny, jak modele językowe radzą sobie z niejasnymi, niekompletnymi lub błędnymi zapytaniami użytkowników. W przeciwieństwie do wcześniejszych benchmarków, takich jak GAIA czy BrowseComp, które zakładają idealnie sformułowane prompty, DiscoBench symuluje chaos rzeczywistego świata.
Ramy te składają się z 211 zadań w jedenastu dziedzinach – w tym nauki, polityki i muzyki – zawierających 463 konkretne punkty niejednoznaczności. Na każdym etapie (checkpoint) agent musi zdecydować, czy kontynuować wyszukiwanie, udzielić odpowiedzi, czy – co najważniejsze – poprosić użytkownika o wyjaśnienie. Aby zasymulować interakcję z człowiekiem, badacze wykorzystali Gemini 3 Flash jako symulator użytkownika oparty na LLM, który dostarcza wskazówek, gdy agent zada wysokiej jakości pytanie uzupełniające.
Kaskada błędów: Dlaczego intensywniejsze wyszukiwanie nie jest lepsze
Badanie identyfikuje niebezpieczny wzorzec: gdy agent napotyka niejednoznaczną encję lub sprzeczne kryteria, często decyduje się na „intensywniejsze wyszukiwanie” zamiast poprosić o pomoc. Prowadzi to do zjawiska, w którym model wykonuje poprawne pod względem składniowym wyszukiwania, które są jednak fundamentalnie błędnie skierowane.
Dane pokazują, że „intensywniejsze wyszukiwanie” może w rzeczywistości obniżyć dokładność. W profilu „SearchHeavyGuess” – gdzie modele wielokrotnie przeszukują dane, ale ostatecznie zgadują zamiast prosić o wyjaśnienie – wskaźnik sukcesu spadł do 51,9%. W przeciwieństwie do tego, modele stosujące strategię „SearchThenAsk” osiągnęły znacznie wyższy wskaźnik sukcesu na poziomie 93,4%. Dowodzi to, że przyczyną porażki nie jest brak umiejętności pozyskiwania informacji, lecz brak sprawczości konwersacyjnej (conversational agency).
Benchmarki wydajności wiodących modeli
Testowanie jedenastu czołowych modeli ujawniło otrzeźwiającą rzeczywistość: nawet liderzy branży mają trudności z przebiciem bariery 50% dokładności w obliczu niejednoznaczności.
- Doubao Seed 2.0 Pro prowadził zestaw z dokładnością end-to-end na poziomie 43,1%.
- Gemini 3.1 Pro Preview podążał tuż za nim z wynikiem 40,8%.
- Claude Opus 4.7 osiągnął 39,8%, mimo wyższego wskaźnika zaliczania etapów (57%).
- Qwen3.6 Max oraz MiniMax M2.7 zostały znacznie w tyle, osiągając odpowiednio 12,3% i 16,1%.
Co ciekawe, nawet gdy badacze zastosowali „prowadzony” (Guided) prompt systemowy, wyraźnie instruujący modele, aby zwracały uwagę na niejednoznaczność, dokładność end-to-end wzrosła jedynie nieznacznie – z 28,6% do 33,7%. Sugeruje to, że „wykrywanie” niejednoznaczności oraz „wiedza, jak ją rozwiązać poprzez interakcję” to dwie odrębne umiejętności poznawcze.
Implikacje dla krajobrazu AI
Badanie to przesuwa punkt ciężkości rozwoju agentycznej sztucznej inteligencji. Aby budować prawdziwie niezawodnych autonomicznych badaczy, branża musi wyjść poza zwiększanie częstotliwości „wywoływania narzędzi” (tool call) i skupić się na rozumowaniu interaktywnym. Kolejną granicą optymalizacji LLM nie jest tylko lepsze pozyskiwanie informacji, ale rozwój lepszej „logiki wyjaśniania”, aby zapobiegać kumulowaniu się błędów podczas złożonych, wieloetapowych zadań.
Kluczowe wnioski
- Niejednoznaczność jest głównym punktem awarii: Agenci AI zawodzą nie dlatego, że nie potrafią znaleźć informacji, ale dlatego, że nie proszą o wyjaśnienie, gdy zapytanie jest zbyt ogólne.
- Pułapka „intensywnego wyszukiwania”: Wielokrotne przeszukiwanie danych pod kątem niewłaściwej encji tworzy kaskadę błędów, z której trudniej wyjść niż w przypadku zwykłego zgadywania.
- Wykrywanie $\neq$ Rozwiązanie: Wysokie wyniki wykrywania (identyfikacji błędu) nie przekładają się automatycznie na wysoki wskaźnik sukcesu, co uwypukla lukę w sposobie, w jaki modele radzą sobie z rozwiązywaniem problemów w konwersacji.
