AI தேடல் முகவர்கள் ஏன் தோல்வியடைகிறார்கள்: தெளிவற்ற தன்மையின் (Ambiguity) முக்கியமான சிக்கல்
டெவலப்பர்கள் AI முகவர்களின் தர்க்கரீதியான ஆழத்தை (reasoning depth) மேம்படுத்துவதில் கவனம் செலுத்தும் போது, தன்னாட்சி ஆராய்ச்சியில் (autonomous research) உண்மையான தடையானது தேடல் திறன் அல்ல—அது தெளிவற்ற தன்மையைக் (ambiguity) கையாளும் திறன் இல்லாமையாவே ஆகும். மிகவும் மேம்பட்ட LLM-கள் கூட ஒரு நிமிடம் நிறுத்திவிட்டு விளக்கம் கேட்கத் தடுமாறுவதாகவும், இது நீண்ட தர்க்கச் சங்கிலிகளில் (reasoning chains) ஒரு பேரழிவை ஏற்படுத்தும் "பிழைத் தொடர்ச்சியை" (error cascade) உருவாக்குவதாகவும் ஒரு புதிய ஆய்வு வெளிப்படுத்துகிறது.
DiscoBench-ன் முன்னேற்றம்
Tencent Hunyuan மற்றும் Tsinghua பல்கலைக்கழக ஆராய்ச்சியாளர்கள், மொழி மாதிரிகள் தெளிவற்ற, முழுமையற்ற அல்லது தவறான பயனர் வினவல்களை எவ்வாறு கையாளுகின்றன என்பதை மதிப்பிடுவதற்கு வடிவமைக்கப்பட்ட ஒரு சிறப்பு சோதனை கட்டமைப்பான DiscoBench-ஐ அறிமுகப்படுத்தியுள்ளனர். GAIA அல்லது BrowseComp போன்ற முந்தைய அளவுகோல்கள் (benchmarks) சரியாக வடிவமைக்கப்பட்ட தூண்டுதல்களை (prompts) அடிப்படையாகக் கொண்டவை, ஆனால் DiscoBench நிஜ உலகச் சூழலில் நிலவும் குழப்பங்களை உருவகப்படுத்துகிறது.
இந்த கட்டமைப்பானது அறிவியல், அரசியல் மற்றும் இசை உள்ளிட்ட பதினொரு துறைகளில் 211 பணிகளைக் கொண்டுள்ளது, இதில் 463 குறிப்பிட்ட தெளிவற்ற புள்ளிகள் உள்ளன. ஒவ்வொரு சோதனைப் புள்ளியிலும் (checkpoint), ஒரு முகவர் தொடர்ந்து தேட வேண்டுமா, பதிலளிக்க வேண்டுமா அல்லது மிக முக்கியமாக, பயனரிடம் விளக்கம் கேட்க வேண்டுமா என்பதைத் தீர்மானிக்க வேண்டும். மனிதத் தொடர்பை உருவகப்படுத்த, ஆராய்ச்சியாளர்கள் Gemini 3 Flash-ஐ ஒரு LLM சார்ந்த பயனர் உருவகப்படுத்துபவராகப் (user simulator) பயன்படுத்தி, ஒரு முகவர் உயர்தரத் தொடர் கேள்வியைக் கேட்கும்போது குறிப்புகளை வழங்கினர்.
பிழைத் தொடர்ச்சி (Error Cascade): ஏன் அதிகத் தேடல் சிறந்தது அல்ல?
இந்த ஆய்வு ஒரு ஆபத்தான முறையை அடையாளம் காட்டுகிறது: ஒரு முகவர் தெளிவற்ற ஒரு பொருளை அல்லது முரண்பட்ட அளவுகோல்களைச் சந்திக்கும் போது, அது உதவி கேட்பதற்குப் பதிலாக "கடுமையாகத் தேட" (search harder) முனைகிறது. இது மாதிரி (model) சுத்தமான, இலக்கண ரீதியாகச் சரியான தேடல்களைச் செய்தாலும், அவை அடிப்படையில் தவறான திசையில் செல்வதற்குக் காரணமாகிறது.
"அதிகமாகத் தேடுவது" உண்மையில் துல்லியத்தைக் குறைக்கலாம் என்று தரவுகள் காட்டுகின்றன. "SearchHeavyGuess" முறையில்—அதாவது மாதிரிகள் மீண்டும் மீண்டும் தேடிவிட்டு, இறுதியில் விளக்கம் கேட்பதற்குப் பதிலாக யூகிக்க முயற்சிக்கும் போது—வெற்றி விகிதம் 51.9% ஆகக் குறைந்தது. இதற்கு நேர்மாறாக, "SearchThenAsk" உத்தியைப் பயன்படுத்திய மாதிரிகள் 93.4% என்ற மிக உயர்ந்த வெற்றி விகிதத்தைப் பெற்றன. தோல்வி என்பது தகவல் மீட்டெடுப்பில் (information retrieval) இல்லை, மாறாக உரையாடல் முகவர் திறனில் (conversational agency) உள்ளது என்பதை இது நிரூபிக்கிறது.
முன்னணி மாதிரிகளின் செயல்திறன் அளவுகோல்கள்
பதினொரு உயர்தர மாதிரிகளைச் சோதித்ததில் ஒரு கசப்பான உண்மை தெரியவந்தது: தெளிவற்ற தன்மையைச் சந்திக்கும் போது, தொழில்துறையின் முன்னணி நிறுவனங்களின் மாதிரிகள் கூட 50% துல்லியத் தடையைத் தாண்டப் போராடுகின்றன.
- Doubao Seed 2.0 Pro 43.1% முழுமையான துல்லியத்துடன் முன்னிலை வகித்தது.
- Gemini 3.1 Pro Preview 40.8% உடன் அடுத்தபடியாக இருந்தது.
- Claude Opus 4.7 அதிக சோதனைப் புள்ளி வெற்றி விகிதத்தைக் (57%) கொண்டிருந்தபோதிலும், 39.8% மட்டுமே எட்டியது.
- Qwen3.6 Max மற்றும் MiniMax M2.7 முறையே 12.3% மற்றும் 16.1% எனப் பின் தங்கியிருந்தன.
சுவாரஸ்யமாக, ஆராய்ச்சியாளர்கள் மாதிரிகளுக்குத் தெளிவற்ற தன்மையைக் கவனிக்க வேண்டும் என்று ஒரு "Guided" சிஸ்டம் பிராம்ப்ட் (system prompt) வழங்கியபோதும், முழுமையான துல்லியம் 28.6%-லிருந்து 33.7% ஆக மட்டுமே சற்று உயர்ந்தது. தெளிவற்ற தன்மையைக் "கண்டறிவதும்" (detecting), அதை "உரையாடல் மூலம் எவ்வாறு தீர்ப்பது என்று தெரிந்து கொள்வதும்" (knowing how to resolve it via interaction) ஆகிய இரண்டும் இரண்டு வெவ்வேறு அறிவாற்றல் திறன்கள் என்பதை இது உணர்த்துகிறது.
AI நிலப்பரப்பிற்கான தாக்கங்கள்
இந்த ஆராய்ச்சி முகவர் சார்ந்த AI (agentic AI) வளர்ச்சியின் கவனத்தை மாற்றுகிறது. உண்மையிலேயே நம்பகமான தன்னாட்சி ஆராய்ச்சியாளர்களை உருவாக்க, தொழில்துறை "tool call" அதிர்வெண்ணை அதிகரிப்பதையும் தாண்டி, உரையாடல் சார்ந்த தர்க்கத்தில் (interactive reasoning) கவனம் செலுத்த வேண்டும். LLM மேம்பாட்டின் அடுத்த கட்டம் என்பது வெறும் சிறந்த தகவல் மீட்டெடுப்பு மட்டுமல்ல—சிக்கலான, பல படிநிலை பணிகளின் போது பிழைகள் அதிகரிப்பதைத் தடுக்க சிறந்த "விளக்கத் தர்க்கத்தை" (clarification logic) உருவாக்குவதாகும்.
முக்கியக் குறிப்புகள்
- தெளிவற்ற தன்மையே முதன்மையான தோல்விப் புள்ளி: AI முகவர்கள் தகவல்களைக் கண்டறிய முடியாததால் தோல்வியடைவதில்லை, மாறாக ஒரு வினவல் போதுமான விவரங்களைக் கொண்டிருக்காத போது விளக்கம் கேட்கத் தவறுவதால் தோல்வியடைகின்றன.
- "Search-Heavy" பொறி: தவறான பொருளைத் திரும்பத் திரும்பத் தேடுவது ஒரு பிழைத் தொடர்ச்சியை உருவாக்குகிறது, இது வெறும் யூகிக்கப்படுவதை விட மீண்டு வருவதற்கு மிகவும் கடினமானது.
- கண்டறிதல் $\neq$ தீர்வு: அதிக கண்டறிதல் மதிப்பெண்கள் (பிழையை அடையாளம் காணுதல்) தானாகவே அதிக வெற்றி விகிதத்திற்கு வழிவகுப்பதில்லை, இது மாதிரிகள் உரையாடல் மூலம் சிக்கல்களைத் தீர்க்கும் முறையில் உள்ள இடைவெளியை எடுத்துக்காட்டுகிறது.
