AI సెర్చ్ ఏజెంట్లు ఎందుకు విఫలమవుతున్నాయి: అస్పష్టత యొక్క క్లిష్టమైన సమస్య

డెవలపర్లు AI ఏజెంట్ల రీజనింగ్ లోతును (reasoning depth) మెరుగుపరచడంపై దృష్టి పెడుతున్నప్పటికీ, స్వయంప్రతిపత్తి కలిగిన పరిశోధనలో (autonomous research) అసలైన అడ్డంకి సెర్చ్ సామర్థ్యం కాదు—అది అస్పష్టతను (ambiguity) ఎదుర్కోలేకపోవడం. అత్యంత అధునాతన LLMలు కూడా నిలిచిపోయి స్పష్టత కోసం అడగడంలో ఇబ్బంది పడుతున్నాయని, ఇది తరచుగా సుదీర్ఘ రీజనింగ్ గొలుసులలో వినాశకరమైన "ఎర్రర్ కాస్కేడ్" (error cascade) కు దారితీస్తుందని ఒక కొత్త అధ్యయనం వెల్లడిస్తోంది.

DiscoBench విప్లవాత్మక మార్పు

Tencent Hunyuan మరియు Tsinghua University పరిశోధకులు DiscoBenchను పరిచయం చేశారు. ఇది భాషా నమూనాలు (language models) అస్పష్టమైన, అసంపూర్ణమైన లేదా తప్పుగా ఉన్న యూజర్ క్వెరీలను ఎలా ఎదుర్కుంటాయో అంచనా వేయడానికి రూపొందించబడిన ఒక ప్రత్యేకమైన టెస్ట్ ఫ్రేమ్‌వర్క్. ఖచ్చితమైన ప్రాంప్ట్‌లను ఊహించే GAIA లేదా BrowseComp వంటి మునుపటి బెంచ్‌మార్క్‌ల వలె కాకుండా, DiscoBench వాస్తవ ప్రపంచంలోని గందరగోళాన్ని అనుకరిస్తుంది.

ఈ ఫ్రేమ్‌వర్క్ సైన్స్, రాజకీయాలు మరియు సంగీతం వంటి పదకొండు రంగాలలో 211 టాస్క్‌లను కలిగి ఉంది, ఇందులో 463 నిర్దిష్ట అస్పష్టత పాయింట్లు ఉన్నాయి. ప్రతి చెక్‌పాయింట్ వద్ద, ఏజెంట్ సెర్చ్ కొనసాగించాలా, సమాధానం ఇవ్వాలా లేదా అన్నిటికంటే ముఖ్యంగా, యూజర్‌ను స్పష్టత కోసం అడగాలా అనేదాన్ని నిర్ణయించాలి. మానవ పరస్పర చర్యను అనుకరించడానికి, పరిశోధకులు Gemini 3 Flashను LLM ఆధారిత యూజర్ సిమ్యులేటర్‌గా ఉపయోగించారు, తద్వారా ఏజెంట్ నాణ్యమైన ఫాలో-అప్ ప్రశ్న అడిగినప్పుడు క్లూలను అందిస్తుంది.

ఎర్రర్ కాస్కేడ్: ఎక్కువ సెర్చ్ చేయడం ఎందుకు మంచిది కాదు

ఈ అధ్యయనం ఒక ప్రమాదకరమైన నమూనాను గుర్తించింది: ఏజెంట్ ఒక అస్పష్టమైన అంశాన్ని లేదా పరస్పర విరుద్ధమైన ప్రమాణాలను ఎదుర్కొన్నప్పుడు, అది సహాయం కోరడానికి బదులుగా "మరింత కష్టపడి సెర్చ్ చేయడం" (search harder) ఎంచుకుంటుంది. ఇది మోడల్ వ్యాకరణపరంగా సరైన సెర్చ్‌లను చేసినప్పటికీ, అవి ప్రాథమికంగా తప్పు దిశలో వెళ్లే ఒక దృగ్విషయానికి దారితీస్తుంది.

"ఎక్కువగా సెర్చ్ చేయడం" వాస్తవానికి ఖచ్చితత్వాన్ని తగ్గించగలదని డేటా చూపుతోంది. "SearchHeavyGuess" ప్రొఫైల్‌లో—అంటే మోడల్‌లు స్పష్టత కోరడానికి బదులుగా పదేపదే సెర్చ్ చేస్తూ చివరికి ఊహించి సమాధానం చెప్పే విధానంలో—విజయ రేటు 51.9%కి పడిపోయింది. దీనికి విరుద్ధంగా, "SearchThenAsk" వ్యూహాన్ని ఉపయోగించిన మోడల్‌లు 93.4% అధిక విజయ రేటును సాధించాయి. వైఫల్యం అనేది సమాచార సేకరణ (information retrieval) లోపం కాదు, అది సంభాషణా సామర్థ్యం (conversational agency) లోని వైఫల్యం అని ఇది నిరూపిస్తుంది.

ప్రముఖ మోడళ్ల పనితీరు బెంచ్‌మార్క్‌లు

పదకొండు టాప్-టియర్ మోడళ్లను పరీక్షించడం వల్ల ఒక చేదు నిజం వెల్లడైంది: అస్పష్టత ఎదురైనప్పుడు పరిశ్రమలోని అగ్రగామి మోడళ్లు కూడా 50% ఖచ్చితత్వపు అడ్డంకిని అధిగమించడానికి కష్టపడుతున్నాయి.

  • Doubao Seed 2.0 Pro 43.1% ఎండ్-టు-ఎండ్ ఖచ్చితత్వంతో అగ్రస్థానంలో ఉంది.
  • Gemini 3.1 Pro Preview 40.8%తో దాని వెనుకే ఉంది.
  • Claude Opus 4.7 అధిక చెక్‌పాయింట్ పాస్ రేటు (57%) కలిగి ఉన్నప్పటికీ, 39.8% మాత్రమే చేరుకోగలిగింది.
  • Qwen3.6 Max మరియు MiniMax M2.7 వరుసగా 12.3% మరియు 16.1%తో గణనీయంగా వెనుకబడి ఉన్నాయి.

ఆసక్తికరంగా, అస్పష్టతను గమనించాలని మోడళ్లకు స్పష్టంగా చెబుతూ పరిశోధకులు "Guided" సిస్టమ్ ప్రాంప్ట్‌ను అందించినప్పటికీ, ఎండ్-టు-ఎండ్ ఖచ్చితత్వం 28.6% నుండి 33.7%కి స్వల్పంగా మాత్రమే పెరిగింది. అస్పష్టతను "గుర్తించడం" మరియు "పరస్పర చర్య ద్వారా దానిని ఎలా పరిష్కరించాలో తెలుసుకోవడం" అనేవి రెండు వేర్వేరు సంజ్ఞానాత్మక నైపుణ్యాలని (cognitive skills) ఇది సూచిస్తుంది.

AI రంగంపై ప్రభావం

ఈ పరిశోధన ఏజెంటిక్ AI అభివృద్ధి యొక్క దృష్టిని మారుస్తుంది. నిజమైన నమ్మకమైన స్వయంప్రతిపత్తి పరిశోధకులను నిర్మించడానికి, పరిశ్రమ కేవలం "tool call" ఫ్రీక్వెన్సీని పెంచడం నుండి ముందుకు వెళ్లి, interactive reasoning పై దృష్టి పెట్టాలి. LLM ఆప్టిమైజేషన్ యొక్క తదుపరి లక్ష్యం కేవలం మెరుగైన సమాచార సేకరణ మాత్రమే కాదు—సంక్లిష్టమైన, బహుళ-దశల పనుల సమయంలో లోపాలు పెరిగిపోకుండా నిరోధించడానికి మెరుగైన "clarification logic" అభివృద్ధి చేయడం.

ముఖ్య అంశాలు

  • అస్పష్టత ప్రధాన వైఫల్య బిందువు: AI ఏజెంట్లు సమాచారాన్ని కనుగొనలేక విఫలం కావు, కానీ క్వెరీ అసంపూర్తిగా ఉన్నప్పుడు స్పష్టత కోసం అడగడంలో విఫలమవుతాయి.
  • "Search-Heavy" ఉచ్చు: తప్పు అంశం కోసం పదేపదే సెర్చ్ చేయడం వల్ల ఒక ఎర్రర్ కాస్కేడ్ ఏర్పడుతుంది, ఇది కేవలం ఊహించి చెప్పడం కంటే కోలుకోవడం కష్టమైనది.
  • Detection $\neq$ Resolution: అధిక డిటెక్షన్ స్కోర్లు (లోపాన్ని గుర్తించడం) ఆటోమేటిక్‌గా అధిక విజయ రేట్లకు దారితీయవు, ఇది మోడల్‌లు సంభాషణాత్మక సమస్య పరిష్కారాన్ని (conversational problem-solving) ఎలా నిర్వహిస్తాయనే దానిలో ఉన్న అంతరాన్ని తెలియజేస్తుంది.