AI सर्च एजेंट क्यों विफल होते हैं: अस्पष्टता (Ambiguity) की गंभीर समस्या

जबकि डेवलपर्स AI एजेंटों की तर्क क्षमता (reasoning depth) को बेहतर बनाने पर ध्यान केंद्रित कर रहे हैं, स्वायत्त अनुसंधान (autonomous research) में वास्तविक बाधा खोज क्षमता नहीं है—बल्कि अस्पष्टता को संभालने में असमर्थता है। एक नया अध्ययन बताता है कि सबसे उन्नत LLMs भी रुकने और स्पष्टीकरण मांगने में संघर्ष करते हैं, जिससे अक्सर लंबी तर्क श्रृंखलाओं (reasoning chains) में एक विनाशकारी "एरर कैस्केड" (error cascade) की स्थिति पैदा हो जाती है।

DiscoBench की सफलता

Tencent Hunyuan और Tsinghua University के शोधकर्ताओं ने DiscoBench पेश किया है, जो एक विशेष परीक्षण ढांचा (test framework) है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि भाषा मॉडल अस्पष्ट, अपूर्ण या गलत उपयोगकर्ता प्रश्नों को कैसे संभालते हैं। GAIA या BrowseComp जैसे पिछले बेंचमार्क के विपरीत, जो पूरी तरह से तैयार प्रॉम्प्ट्स को मानते हैं, DiscoBench वास्तविक दुनिया की अव्यवस्था (chaos) का अनुकरण करता है।

इस ढांचे में विज्ञान, राजनीति और संगीत सहित ग्यारह क्षेत्रों में 211 कार्य शामिल हैं, जिनमें अस्पष्टता के 463 विशिष्ट बिंदु हैं। प्रत्येक चेकपॉइंट पर, एक एजेंट को यह निर्णय लेना होगा कि क्या खोज जारी रखनी है, उत्तर देना है, या सबसे महत्वपूर्ण बात, उपयोगकर्ता से स्पष्टीकरण मांगना है। मानवीय बातचीत का अनुकरण करने के लिए, शोधकर्ताओं ने Gemini 3 Flash का उपयोग एक LLM-आधारित उपयोगकर्ता सिम्युलेटर के रूप में किया ताकि जब कोई एजेंट उच्च गुणवत्ता वाला फॉलो-अप प्रश्न पूछे, तो संकेत (clues) प्रदान किए जा सकें।

एरर कैस्केड: अधिक खोज करना बेहतर क्यों नहीं है

अध्ययन एक खतरनाक पैटर्न की पहचान करता है: जब कोई एजेंट किसी अस्पष्ट इकाई (entity) या विरोधाभासी मानदंडों (criteria) का सामना करता है, तो वह मदद मांगने के बजाय अक्सर "अधिक मेहनत से खोजने" का विकल्प चुनता है। इससे एक ऐसी घटना पैदा होती है जहाँ मॉडल साफ-सुथरी, व्याकरणिक रूप से सही खोजें करता है जो मौलिक रूप से गलत दिशा में होती हैं।

डेटा दिखाता है कि "अधिक खोजने" से वास्तव में सटीकता कम हो सकती है। "SearchHeavyGuess" प्रोफाइल में—जहाँ मॉडल बार-बार खोजते हैं लेकिन स्पष्टीकरण देने के बजाय अंततः अनुमान लगाते हैं—सफलता दर गिरकर 51.9% हो गई। इसके विपरीत, "SearchThenAsk" रणनीति का उपयोग करने वाले मॉडलों ने 93.4% की बहुत अधिक सफलता दर हासिल की। यह साबित करता है कि विफलता सूचना पुनर्प्राप्ति (information retrieval) की कमी नहीं है, बल्कि संवादात्मक एजेंसी (conversational agency) की विफलता है।

प्रमुख मॉडलों के प्रदर्शन बेंचमार्क

ग्यारह शीर्ष-स्तरीय मॉडलों के परीक्षण से एक कड़वी सच्चाई सामने आई: अस्पष्टता का सामना करने पर उद्योग के दिग्गज भी 50% सटीकता की बाधा को तोड़ने के लिए संघर्ष करते हैं।

  • Doubao Seed 2.0 Pro 43.1% एंड-टू-एंड सटीकता के साथ सबसे आगे रहा।
  • Gemini 3.1 Pro Preview 40.8% के साथ निकटतम स्थान पर रहा।
  • Claude Opus 4.7 39.8% तक पहुँचा, बावजूद इसके कि इसकी चेकपॉइंट पास दर (57%) अधिक थी।
  • Qwen3.6 Max और MiniMax M2.7 क्रमशः 12.3% और 16.1% के साथ काफी पीछे रहे।

दिलचस्प बात यह है कि जब शोधकर्ताओं ने एक "Guided" सिस्टम प्रॉम्प्ट प्रदान किया जिसमें मॉडलों को स्पष्ट रूप से अस्पष्टता पर ध्यान देने के लिए कहा गया था, तब भी एंड-टू-एंड सटीकता केवल 28.6% से बढ़कर 33.7% हुई। यह सुझाव देता है कि अस्पष्टता का "पता लगाना" और "बातचीत के माध्यम से उसे कैसे हल किया जाए यह जानना" दो अलग-अलग संज्ञानात्मक कौशल (cognitive skills) हैं।

AI परिदृश्य के लिए निहितार्थ

यह शोध एजेंटिक AI विकास के फोकस को बदल देता है। वास्तव में विश्वसनीय स्वायत्त शोधकर्ता बनाने के लिए, उद्योग को "टूल कॉल" (tool call) की आवृत्ति बढ़ाने से आगे बढ़कर इंटरैक्टिव रीजनिंग (interactive reasoning) पर ध्यान केंद्रित करना चाहिए। LLM अनुकूलन के लिए अगला मोर्चा केवल बेहतर पुनर्प्राप्ति (retrieval) नहीं है—बल्कि जटिल, बहु-चरणीय कार्यों के दौरान त्रुटियों को बढ़ने से रोकने के लिए बेहतर "स्पष्टीकरण तर्क" (clarification logic) का विकास करना है।

मुख्य बातें

  • अस्पष्टता प्राथमिक विफलता बिंदु है: AI एजेंट इसलिए विफल नहीं होते क्योंकि वे जानकारी नहीं ढूँढ सकते, बल्कि इसलिए विफल होते हैं क्योंकि जब कोई क्वेरी अपर्याप्त रूप से निर्दिष्ट (underspecified) होती है, तो वे स्पष्टीकरण मांगने में विफल रहते हैं।
  • "सर्च-हैवी" (Search-Heavy) जाल: गलत इकाई के लिए बार-बार खोजना एक ऐसा एरर कैस्केड बनाता है जिससे उबरना केवल अनुमान लगाने की तुलना में अधिक कठिन होता है।
  • डिटेक्शन $\neq$ रेजोल्यूशन: उच्च डिटेक्शन स्कोर (त्रुटि की पहचान करना) स्वचालित रूप से उच्च सफलता दर में नहीं बदलता है, जो यह दर्शाता है कि मॉडल संवादात्मक समस्या-समाधान (conversational problem-solving) को कैसे संभालते हैं, इसमें एक अंतर है।