എന്തുകൊണ്ടാണ് AI സെർച്ച് ഏജന്റുകൾ പരാജയപ്പെടുന്നത്: അവ്യക്തതയുടെ നിർണ്ണായക പ്രശ്നം
ഡെവലപ്പർമാർ AI ഏജന്റുകളുടെ റീസണിംഗ് ഡെപ്ത്ത് (reasoning depth) മെച്ചപ്പെടുത്തുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുമ്പോൾ, സ്വയംഭരണാധികാരമുള്ള (autonomous) ഗവേഷണത്തിലെ യഥാർത്ഥ തടസ്സം സെർച്ച് ചെയ്യാനുള്ള കഴിവിനല്ല—മറിച്ച് അവ്യക്തത കൈകാര്യം ചെയ്യാനുള്ള കഴിവില്ലായ്മയാണ്. ഏറ്റവും നൂതനമായ LLM-കൾ പോലും ഒരു നിമിഷം നിർത്തി കാര്യങ്ങൾ വ്യക്തമാക്കാൻ ചോദിക്കാൻ പ്രയാസപ്പെടുന്നുവെന്നും, ഇത് ദീർഘമായ റീസണിംഗ് ചെയിനുകളിൽ (reasoning chains) വലിയ തോതിലുള്ള ഒരു "എറർ കാസ്കേഡ്" (error cascade) ഉണ്ടാക്കുന്നുവെന്നും പുതിയൊരു പഠനം വെളിപ്പെടുത്തുന്നു.
DiscoBench-ന്റെ മുന്നേറ്റം
Tencent Hunyuan, Tsinghua University എന്നിവയിലെ ഗവേഷകർ DiscoBench എന്ന ഒരു പ്രത്യേക ടെസ്റ്റ് ഫ്രെയിംവർക്ക് അവതരിപ്പിച്ചു. ഭാഷാ മാതൃകകൾ (language models) അവ്യക്തമോ, അപൂർണ്ണമോ, അല്ലെങ്കിൽ തെറ്റായതോ ആയ ഉപയോക്താക്കളുടെ ചോദ്യങ്ങൾ എങ്ങനെ കൈകാര്യം ചെയ്യുന്നു എന്ന് വിലയിരുത്താനാണ് ഇത് രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്. കൃത്യമായ പ്രോംപ്റ്റുകൾ (prompts) ഉണ്ടെന്ന് കരുതുന്ന GAIA അല്ലെങ്കിൽ BrowseComp പോലുള്ള മുൻപത്തെ ബെഞ്ച്മാർക്കുകളിൽ നിന്ന് വ്യത്യസ്തമായി, യഥാർത്ഥ ലോകത്തെ ആശയക്കുഴപ്പങ്ങൾ DiscoBench അനുകരിക്കുന്നു.
ശാസ്ത്രം, രാഷ്ട്രീയം, സംഗീതം എന്നിവയുൾപ്പെടെ പതിനൊന്ന് മേഖലകളിലായി 211 ടാസ്ക്കുകൾ ഉൾക്കൊള്ളുന്ന ഈ ഫ്രെയിംവർക്കിൽ 463 പ്രത്യേക അവ്യക്തതാ പോയിന്റുകൾ ഉണ്ട്. ഓരോ ചെക്ക്പോയിന്റിലും, സെർച്ച് തുടരണോ, ഉത്തരം നൽകണോ, അതോ ഏറ്റവും പ്രധാനമായി ഉപയോക്താവിനോട് കാര്യങ്ങൾ വ്യക്തമാക്കാൻ ചോദിക്കണോ എന്ന് ഏജന്റ് തീരുമാനിക്കണം. മനുഷ്യ ഇടപെടലുകൾ അനുകരിക്കുന്നതിനായി, ഗവേഷകർ Gemini 3 Flash-നെ ഒരു LLM അധിഷ്ഠിത ഉപയോക്തൃ സിമുലേറ്ററായി ഉപയോഗിച്ചു. ഒരു ഏജന്റ് മികച്ച രീതിയിലുള്ള തുടർചോദ്യങ്ങൾ ചോദിക്കുമ്പോൾ സൂചനകൾ നൽകാൻ ഇത് സഹായിക്കുന്നു.
എറർ കാസ്കേഡ്: കൂടുതൽ സെർച്ച് ചെയ്യുന്നത് എപ്പോഴും നല്ലതല്ല
പഠനം ഒരു അപകടകരമായ രീതി തിരിച്ചറിയുന്നു: ഒരു ഏജന്റ് അവ്യക്തമായ ഒരു വസ്തുവിനെയോ അല്ലെങ്കിൽ പരസ്പരവിരുദ്ധമായ മാനദണ്ഡങ്ങളെയോ നേരിടുമ്പോൾ, സഹായം ചോദിക്കുന്നതിന് പകരം "കൂടുതൽ കഠിനമായി സെർച്ച് ചെയ്യാൻ" അത് പലപ്പോഴും തിരഞ്ഞെടുക്കുന്നു. ഇത് മോഡൽ കൃത്യമായ വ്യാകരണത്തോടെ സെർച്ച് നടത്തുന്നുണ്ടെങ്കിലും, അടിസ്ഥാനപരമായി തെറ്റായ ദിശയിലേക്കാണ് അത് നീങ്ങുന്ന ഒരു അവസ്ഥയ്ക്ക് കാരണമാകുന്നു.
"കൂടുതൽ സെർച്ച് ചെയ്യുന്നത്" യഥാർത്ഥത്തിൽ കൃത്യത കുറയ്ക്കാൻ കാരണമാകുമെന്ന് ഡാറ്റ കാണിക്കുന്നു. "SearchHeavyGuess" പ്രൊഫൈലിൽ—അതായത് മോഡലുകൾ വീണ്ടും വീണ്ടും സെർച്ച് ചെയ്യുകയും എന്നാൽ കാര്യങ്ങൾ വ്യക്തമാക്കുന്നതിന് പകരം ഊഹിച്ചു പറയുകയും ചെയ്യുന്ന സാഹചര്യത്തിൽ—വിജയ നിരക്ക് 51.9% ആയി കുറഞ്ഞു. നേരെമറിച്ച്, "SearchThenAsk" തന്ത്രം ഉപയോഗിച്ച മോഡലുകൾ 93.4% എന്ന ഉയർന്ന വിജയ നിരക്ക് കൈവരിച്ചു. വിവരങ്ങൾ ശേഖരിക്കുന്നതിലെ കുറവല്ല, മറിച്ച് സംഭാഷണപരമായ ഏജൻസിയിലെ (conversational agency) പരാജയമാണ് ഇതിന് കാരണമെന്ന് ഇത് തെളിയിക്കുന്നു.
പ്രമുഖ മോഡലുകളുടെ പെർഫോമൻസ് ബെഞ്ച്മാർക്കുകൾ
പതിനൊന്ന് മികച്ച മോഡലുകളെ പരീക്ഷിച്ചപ്പോൾ ഒരു കയ്പ്പേറിയ യാഥാർത്ഥ്യം വെളിപ്പെട്ടു: അവ്യക്തത നേരിടുമ്പോൾ വ്യവസായ രംഗത്തെ പ്രമുഖർ പോലും 50% കൃത്യത എന്ന പരിധി മറികടക്കാൻ ബുദ്ധിമുട്ടുന്നു.
- Doubao Seed 2.0 Pro 43.1% എൻഡ്-ടു-എൻഡ് കൃത്യതയോടെ മുന്നിലെത്തി.
- Gemini 3.1 Pro Preview 40.8% എന്ന നിലയിൽ തൊട്ടുപിന്നിലായി.
- Claude Opus 4.7 ഉയർന്ന ചെക്ക്പോയിന്റ് പാസ്സ് റേറ്റ് (57%) ഉണ്ടായിരുന്നിട്ടും 39.8% ആണ് കൈവരിച്ചത്.
- Qwen3.6 Max, MiniMax M2.7 എന്നിവ യഥാക്രമം 12.3%, 16.1% എന്നിങ്ങനെ വളരെ പിന്നിലായി.
രസകരമായ കാര്യം എന്തെന്നാൽ, അവ്യക്തത ശ്രദ്ധിക്കാൻ മോഡലുകളോട് പ്രത്യേകം നിർദ്ദേശിക്കുന്ന ഒരു "Guided" സിസ്റ്റം പ്രോംപ്റ്റ് ഗവേഷകർ നൽകിയിട്ടും, എൻഡ്-ടു-എൻഡ് കൃത്യത 28.6%-ൽ നിന്ന് 33.7% ആയി നേരിയ തോതിൽ മാത്രമേ വർദ്ധിച്ചുള്ളൂ. ഒരു അവ്യക്തത "കണ്ടെത്തുക" എന്നതും, ആശയവിനിമയത്തിലൂടെ അത് "എങ്ങനെ പരിഹരിക്കണമെന്ന് അറിയുക" എന്നതും രണ്ട് വ്യത്യസ്ത വൈജ്ഞാനിക കഴിവുകളാണെന്ന് ഇത് സൂചിപ്പിക്കുന്നു.
AI മേഖലയിലെ പ്രത്യാഘാതങ്ങൾ
ഈ ഗവേഷണം ഏജന്റിക് AI വികസനത്തിന്റെ ശ്രദ്ധ മാറ്റുന്നു. യഥാർത്ഥത്തിൽ വിശ്വസനീയമായ സ്വയംഭരണാധികാരമുള്ള ഗവേഷകരെ നിർമ്മിക്കുന്നതിന്, വ്യവസായം "tool call" ഫ്രീക്വൻസി വർദ്ധിപ്പിക്കുന്നതിലുപരി interactive reasoning-ൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കണം. LLM ഒപ്റ്റിമൈസേഷനിലെ അടുത്ത ഘട്ടം മികച്ച വിവരശേഖരണം മാത്രമല്ല—സങ്കീർണ്ണമായ, ബഹുതല ഘട്ടങ്ങളുള്ള ജോലികൾക്കിടയിൽ പിശകുകൾ വർദ്ധിക്കുന്നത് തടയാൻ മികച്ച "clarification logic" വികസിപ്പിക്കുക എന്നതാണ്.
പ്രധാന കാര്യങ്ങൾ
- അവ്യക്തതയാണ് പ്രധാന പരാജയ കാരണങ്ങൾ: വിവരങ്ങൾ കണ്ടെത്താൻ കഴിയാത്തതുകൊണ്ടല്ല AI ഏജന്റുകൾ പരാജയപ്പെടുന്നത്, മറിച്ച് ഒരു ചോദ്യം അപൂർണ്ണമായിരിക്കുമ്പോൾ അത് വ്യക്തമാക്കാൻ ചോദിക്കാൻ അവർ പരാജയപ്പെടുന്നതുകൊണ്ടാണ്.
- "Search-Heavy" കെണി: തെറ്റായ വസ്തുവിനായി വീണ്ടും വീണ്ടും സെർച്ച് ചെയ്യുന്നത് ഒരു എറർ കാസ്കേഡ് സൃഷ്ടിക്കുന്നു, ഇത് വെറുതെ ഊഹിച്ചു പറയുന്നതിനേക്കാൾ തിരുത്താൻ പ്രയാസമുള്ളതാണ്.
- Detection $\neq$ Resolution: ഉയർന്ന ഡിറ്റക്ഷൻ സ്കോറുകൾ (ഒരു പിശക് തിരിച്ചറിയുന്നത്) ഉയർന്ന വിജയ നിരക്കിന് നേരിട്ട് കാരണമാകുന്നില്ല, ഇത് മോഡലുകൾ സംഭാഷണത്തിലൂടെ പ്രശ്നങ്ങൾ പരിഹരിക്കുന്ന രീതിയിലുള്ള ഒരു വിടവ് ചൂണ്ടിക്കാണിക്കുന്നു.
