AI સર્ચ એજન્ટ્સ કેમ નિષ્ફળ જાય છે: અસ્પષ્ટતાની ગંભીર સમસ્યા

જ્યારે ડેવલપર્સ AI એજન્ટ્સની તર્ક ક્ષમતા (reasoning depth) સુધારવા પર ધ્યાન કેન્દ્રિત કરે છે, ત્યારે સ્વાયત્ત સંશોધન (autonomous research) માં વાસ્તવિક અવરોધ સર્ચ ક્ષમતા નથી—તે અસ્પષ્ટતાને સંભાળવાની અસમર્થતા છે. એક નવો અભ્યાસ દર્શાવે છે કે અત્યંત અદ્યતન LLMs પણ થોભીને સ્પષ્ટતા માંગવા માટે સંઘર્ષ કરે છે, જે ઘણીવાર લાંબી તર્ક સાંકળોમાં વિનાશક "error cascade" (ભૂલનો પ્રવાહ) તરફ દોરી જાય છે.

DiscoBench ની મોટી સફળતા

Tencent Hunyuan અને Tsinghua University ના સંશોધકોએ DiscoBench રજૂ કર્યું છે, જે એક વિશિષ્ટ ટેસ્ટ ફ્રેમવર્ક છે જે ભાષા મોડલ્સ અસ્પષ્ટ, અધૂરી અથવા ખોટી યુઝર ક્વેરીઝને કેવી રીતે સંભાળે છે તેનું મૂલ્યાંકન કરવા માટે બનાવવામાં આવ્યું છે. GAIA અથવા BrowseComp જેવા અગાઉના બેન્ચમાર્કથી વિપરીત, જે સંપૂર્ણ રીતે રચાયેલ પ્રોમ્પ્ટ્સ માની લે છે, DiscoBench વાસ્તવિક દુનિયાની અરાજકતાનું અનુકરણ કરે છે.

આ ફ્રેમવર્કમાં વિજ્ઞાન, રાજકારણ અને સંગીત સહિત અગિયાર ક્ષેત્રોમાં 211 કાર્યો સામેલ છે—જેમાં અસ્પષ્ટતાના 463 ચોક્કસ મુદ્દાઓ છે. દરેક ચેકપોઈન્ટ પર, એજન્ટે નક્કી કરવું જોઈએ કે સર્ચ ચાલુ રાખવું, જવાબ આપવો, અથવા સૌથી મહત્વનું, યુઝર પાસે સ્પષ્ટતા માંગવી. માનવ સંવાદનું અનુકરણ કરવા માટે, સંશોધકોએ Gemini 3 Flash નો ઉપયોગ LLM-આધારિત યુઝર સિમ્યુલેટર તરીકે કર્યો હતો, જેથી જ્યારે એજન્ટ ઉચ્ચ ગુણવત્તાવાળો ફોલો-અપ પ્રશ્ન પૂછે ત્યારે તે સંકેતો આપી શકે.

Error Cascade: વધુ સર્ચ કરવું કેમ વધુ સારું નથી

અભ્યાસ એક જોખમી પેટર્ન ઓળખે છે: જ્યારે એજન્ટ કોઈ અસ્પષ્ટ એન્ટિટી અથવા વિરોધાભાસી માપદંડોનો સામનો કરે છે, ત્યારે તે મદદ માંગવાને બદલે ઘણીવાર "વધુ સખત રીતે સર્ચ" કરવાનું પસંદ કરે છે. આનાથી એવી ઘટના બને છે જ્યાં મોડલ સ્વચ્છ અને વ્યાકરણની દૃષ્ટિએ સાચી સર્ચ કરે છે પરંતુ તે મૂળભૂત રીતે ખોટી દિશામાં હોય છે.

ડેટા દર્શાવે છે કે "વધુ સર્ચ કરવાથી" વાસ્તવમાં ચોકસાઈ ઘટી શકે છે. "SearchHeavyGuess" પ્રોફાઇલમાં—જ્યાં મોડલ્સ વારંવાર સર્ચ કરે છે પરંતુ સ્પષ્ટતા કરવાને બદલે અંતે અનુમાન લગાવે છે—સફળતાનો દર ઘટીને 51.9% થઈ ગયો હતો. તેનાથી વિપરીત, જે મોડલ્સ "SearchThenAsk" વ્યૂહરચનાનો ઉપયોગ કરે છે તેઓએ 93.4% નો ઘણો ઊંચો સફળતા દર હાંસલ કર્યો હતો. આ સાબિત કરે છે કે નિષ્ફળતા માહિતી મેળવવાની (information retrieval) અછત નથી, પરંતુ સંવાદલક્ષી એજન્સી (conversational agency) ની નિષ્ફળતા છે.

અગ્રણી મોડલ્સના પરફોર્મન્સ બેન્ચમાર્ક

અગિયાર ટોપ-ટિયર મોડલ્સનું પરીક્ષણ કરવાથી એક કડવું સત્ય સામે આવ્યું છે: અસ્પષ્ટતાનો સામનો કરતી વખતે ઉદ્યોગના અગ્રણીઓ પણ 50% ચોકસાઈના અવરોધને તોડવા માટે સંઘર્ષ કરે છે.

  • Doubao Seed 2.0 Pro એ 43.1% એન્ડ-ટુ-એન્ડ ચોકસાઈ સાથે મોખરે રહ્યું.
  • Gemini 3.1 Pro Preview 40.8% સાથે તેની પાછળ રહ્યું.
  • Claude Opus 4.7 39.8% સુધી પહોંચ્યું, હોવા છતાં તેનો ચેકપોઈન્ટ પાસ રેટ (57%) વધારે હતો.
  • Qwen3.6 Max અને MiniMax M2.7 અનુક્રમે 12.3% અને 16.1% સાથે નોંધપાત્ર રીતે પાછળ રહ્યા.

રસપ્રદ વાત એ છે કે, જ્યારે સંશોધકોએ "Guided" સિસ્ટમ પ્રોમ્પ્ટ આપ્યો જે મોડલ્સને અસ્પષ્ટતા પર ધ્યાન આપવા માટે સ્પષ્ટપણે કહે છે, ત્યારે પણ એન્ડ-ટુ-એન્ડ ચોકસાઈ માત્ર 28.6% થી વધીને 33.7% થઈ. આ સૂચવે છે કે અસ્પષ્ટતાને "શોધવી" (detecting) અને "સંવાદ દ્વારા તેને કેવી રીતે ઉકેલવી તે જાણવું" એ બે અલગ અલગ જ્ઞાનાત્મક કૌશલ્યો (cognitive skills) છે.

AI લેન્ડસ્કેપ માટે અસરો

આ સંશોધન એજન્ટિક AI ડેવલપમેન્ટનું ધ્યાન બદલે છે. ખરેખર વિશ્વસનીય સ્વાયત્ત સંશોધકો બનાવવા માટે, ઉદ્યોગે "tool call" ની આવૃત્તિ વધારવા થી આગળ વધીને interactive reasoning (સંવાદાત્મક તર્ક) પર ધ્યાન કેન્દ્રિત કરવું જોઈએ. LLM ઓપ્ટિમાઇઝેશન માટે આગામી સીમા માત્ર બહેતર રીટ્રીવલ નથી—તે જટિલ, બહુ-પગલાંવાળા કાર્યો દરમિયાન ભૂલોને વધતી અટકાવવા માટે વધુ સારા "clarification logic" (સ્પષ્ટતા માટેના તર્ક) નો વિકાસ છે.

મુખ્ય મુદ્દાઓ

  • અસ્પષ્ટતા એ નિષ્ફળતાનું મુખ્ય બિંદુ છે: AI એજન્ટો માહિતી ન મળી શકવાને કારણે નિષ્ફળ જતા નથી, પરંતુ જ્યારે ક્વેરી અધૂરી હોય ત્યારે સ્પષ્ટતા માંગવામાં નિષ્ફળતાના કારણે નિષ્ફળ જાય છે.
  • "Search-Heavy" જાળ: ખોટી એન્ટિટી માટે વારંવાર સર્ચ કરવાથી એક એવો error cascade સર્જાય છે જેમાંથી બહાર આવવું માત્ર અનુમાન લગાવવા કરતાં વધુ મુશ્કેલ હોય છે.
  • Detection $\neq$ Resolution: ઊંચા ડિટેક્શન સ્કોર (ભૂલ ઓળખવી) આપમેળે ઊંચા સફળતાના દરમાં રૂપાંતરિત થતા નથી, જે મોડલ્સ સંવાદલક્ષી સમસ્યા-નિવારણમાં કેવી રીતે કામ કરે છે તેમાં રહેલી ખામીને રેખાંકિત કરે છે.