AI सर्च एजंट्स का अपयशी ठरतात: संदिग्धतेची (Ambiguity) गंभीर समस्या
डेव्हलपर्स AI एजंट्सच्या तर्कक्षमतेची (reasoning depth) खोली सुधारण्यावर लक्ष केंद्रित करत असताना, स्वायत्त संशोधनातील (autonomous research) खरी अडचण शोध क्षमता नसून संदिग्धता हाताळण्यात येणारी असमर्थता आहे. एका नवीन अभ्यासातून असे दिसून आले आहे की, अत्यंत प्रगत LLMs देखील थांबून स्पष्टीकरण मागण्यासाठी संघर्ष करतात, ज्यामुळे अनेकदा लांब तर्क साखळीमध्ये (reasoning chains) एक विनाशकारी "एरर कॅस्केड" (error cascade) निर्माण होतो.
DiscoBench चा breakthrough
Tencent Hunyuan आणि Tsinghua University च्या संशोधकांनी DiscoBench सादर केले आहे, जे एक विशेष टेस्ट फ्रेमवर्क आहे. हे फ्रेमवर्क भाषा मॉडेल्स अस्पष्ट, अपूर्ण किंवा चुकीच्या युजर क्वेरीज (user queries) कशा हाताळतात याचे मूल्यांकन करण्यासाठी डिझाइन केलेले आहे. GAIA किंवा BrowseComp सारख्या मागील बेंचमार्कच्या उलट, जे पूर्णपणे तयार प्रॉम्प्ट्स गृहीत धरतात, DiscoBench वास्तविक जगातील गोंधळ (chaos) सिम्युलेट करते.
या फ्रेमवर्कमध्ये विज्ञान, राजकारण आणि संगीत यांसह अकरा क्षेत्रांमधील २११ कार्ये (tasks) समाविष्ट आहेत, ज्यामध्ये संदिग्धतेचे ४६३ विशिष्ट मुद्दे आहेत. प्रत्येक चेकपॉइंटवर, एजंटला शोध सुरू ठेवायचे की उत्तर द्यायचे किंवा सर्वात महत्त्वाचे म्हणजे युजरला स्पष्टीकरण विचारायचे, याचा निर्णय घ्यावा लागतो. मानवी संवाद सिम्युलेट करण्यासाठी, संशोधकांनी Gemini 3 Flash चा वापर LLM-आधारित युजर सिम्युलेटर म्हणून केला, जेणेकरून जेव्हा एखादा एजंट उच्च दर्जाचा फॉलो-अप प्रश्न विचारतो, तेव्हा त्याला संकेत (clues) मिळू शकतील.
एरर कॅस्केड: अधिक शोध घेणे चांगले का नाही
हा अभ्यास एक धोकादायक पॅटर्न ओळखतो: जेव्हा एखादा एजंट संदिग्ध घटक (ambiguous entity) किंवा परस्परविरोधी निकषांचा संच आढळतो, तेव्हा तो मदत मागण्याऐवजी "अधिक जोरात शोधणे" (search harder) निवडतो. यामुळे एक अशी स्थिती निर्माण होते जिथे मॉडेल व्याकरणदृष्ट्या अचूक शोध घेते, परंतु ते मूलभूतपणे चुकीच्या दिशेने वळलेले असतात.
डेटा दर्शवतो की "अधिक शोध घेतल्याने" प्रत्यक्षात अचूकता कमी होऊ शकते. "SearchHeavyGuess" प्रोफाइलमध्ये—जिथे मॉडेल्स वारंवार शोध घेतात परंतु स्पष्टीकरण देण्याऐवजी शेवटी अंदाज लावतात—यशस्वीतेचा दर ५१.९% पर्यंत खाली आला. याउलट, "SearchThenAsk" धोरण वापरणाऱ्या मॉडेल्सनी ९३.४% असा खूप उच्च यश दर गाठला. यावरून सिद्ध होते की अपयश हे माहिती मिळवण्याच्या (information retrieval) अभावामुळे नाही, तर संवादात्मक एजन्सीमधील (conversational agency) अपयशामुळे आहे.
आघाडीच्या मॉडेल्सचे परफॉर्मन्स बेंचमार्क
अकरा उच्च दर्जाच्या मॉडेल्सच्या चाचणीतून एक कडू वास्तव समोर आले आहे: संदिग्धतेचा सामना करताना उद्योगातील आघाडीचे मॉडेल्स देखील ५०% अचूकतेचा टप्पा ओलांडण्यासाठी संघर्ष करत आहेत.
- Doubao Seed 2.0 Pro ने ४३.१% एंड-टू-एंड अचूकतेसह आघाडी घेतली.
- Gemini 3.1 Pro Preview ४०.८% सह जवळून पाठलाग करत होते.
- Claude Opus 4.7 ने ३९.८% अचूकता गाठली, जरी त्याचा चेकपॉइंट पास रेट (५७%) जास्त होता.
- Qwen3.6 Max आणि MiniMax M2.7 अनुक्रमे १२.३% आणि १६.१% वर लक्षणीयरीत्या मागे होते.
विशेष म्हणजे, संशोधकांनी मॉडेल्सना संदिग्धतेबद्दल सावध राहण्यास सांगणारा "Guided" सिस्टम प्रॉम्प्ट दिला तरी, एंड-टू-एंड अचूकता केवळ २८.६% वरून ३३.७% पर्यंत किंचित वाढली. यावरून असे सुचते की संदिग्धता "ओळखणे" (detecting) आणि संवादाद्वारे ती "कशी सोडवायची हे जाणून घेणे" (knowing how to resolve it via interaction) या दोन भिन्न संज्ञानात्मक कौशल्ये (cognitive skills) आहेत.
AI क्षेत्रासाठी याचे परिणाम
हे संशोधन एजन्टिक AI (agentic AI) विकासाचे लक्ष बदलत आहे. खरोखरच विश्वसनीय स्वायत्त संशोधक तयार करण्यासाठी, उद्योगाला केवळ "tool call" वारंवारता वाढवण्यापलीकडे जाऊन interactive reasoning वर लक्ष केंद्रित करणे आवश्यक आहे. LLM ऑप्टिमायझेशनची पुढची सीमा केवळ चांगली माहिती मिळवणे (retrieval) नाही—तर जटिल, बहु-स्तरीय कामांदरम्यान चुकांची साखळी रोखण्यासाठी अधिक चांगल्या "clarification logic" चा विकास करणे ही आहे.
मुख्य निष्कर्ष
- संदिग्धता हा अपयशाचा मुख्य बिंदू आहे: AI एजंट्स माहिती शोधू शकत नाहीत म्हणून अपयशी ठरत नाहीत, तर जेव्हा एखादी क्वेरी अपूर्ण असते तेव्हा ते स्पष्टीकरण मागण्यात अपयशी ठरतात.
- "Search-Heavy" सापळा: चुकीच्या घटकासाठी वारंवार शोध घेतल्यामुळे एक 'एरर कॅस्केड' तयार होतो, ज्यातून सावरणे केवळ अंदाज लावण्यापेक्षा अधिक कठीण असते.
- Detection $\neq$ Resolution: उच्च डिटेक्शन स्कोअर (चूक ओळखणे) म्हणजे आपोआप उच्च यश दर मिळणे नव्हे, जे मॉडेल्स संवादात्मक समस्या निवारण (conversational problem-solving) कसे हाताळतात यातील तफावत अधोरेखित करते.
