AI ਸਰਚ ਏਜੰਟ ਕਿਉਂ ਅਸਫਲ ਹੁੰਦੇ ਹਨ: ਅਸਪਸ਼ਟਤਾ (Ambiguity) ਦੀ ਗੰਭੀਰ ਸਮੱਸਿਆ
ਜਦੋਂ ਡਿਵੈਲਪਰ AI ਏਜੰਟਾਂ ਦੀ ਤਰਕ ਦੀ ਡੂੰਘਾਈ (reasoning depth) ਨੂੰ ਸੁਧਾਰਨ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੇ ਹਨ, ਤਾਂ ਖੁਦਮੁਖਤਿਆਰ ਖੋਜ (autonomous research) ਵਿੱਚ ਅਸਲ ਰੁਕਾਵਟ ਸਰਚ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਨਹੀਂ ਹੈ—ਬਲਕਿ ਅਸਪਸ਼ਟਤਾ (ambiguity) ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਅਸਮਰੱਥਾ ਹੈ। ਇੱਕ ਨਵਾਂ ਅਧਿਐਨ ਦੱਸਦਾ ਹੈ ਕਿ ਸਭ ਤੋਂ ਉੱਨਤ LLMs ਵੀ ਰੁਕਣ ਅਤੇ ਸਪਸ਼ਟੀਕਰਨ ਮੰਗਣ ਵਿੱਚ ਸੰਘਰਸ਼ ਕਰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਅਕਸਰ ਲੰਬੀਆਂ ਤਰਕ ਲੜੀਆਂ ਵਿੱਚ ਇੱਕ ਭਿਆਨਕ "error cascade" (ਗਲਤੀਆਂ ਦੀ ਲੜੀ) ਪੈਦਾ ਹੋ ਜਾਂਦੀ ਹੈ।
DiscoBench ਦੀ ਵੱਡੀ ਪ੍ਰਾਪਤੀ
Tencent Hunyuan ਅਤੇ Tsinghua University ਦੇ ਖੋਜਕਰਤਾਵਾਂ ਨੇ DiscoBench ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਟੈਸਟ ਫਰੇਮਵਰਕ ਹੈ। ਇਸ ਨੂੰ ਇਹ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ ਕਿ ਭਾਸ਼ਾ ਮਾਡਲ ਅਸਪਸ਼ਟ, ਅਧੂਰੀਆਂ ਜਾਂ ਗਲਤ ਯੂਜ਼ਰ ਕੁਐਰੀਆਂ (queries) ਨੂੰ ਕਿਵੇਂ ਸੰਭਾਲਦੇ ਹਨ। GAIA ਜਾਂ BrowseComp ਵਰਗੇ ਪਿਛਲੇ ਬੈਂਚਮਾਰਕਸ ਦੇ ਉਲਟ, ਜੋ ਕਿ ਬਿਲਕੁਲ ਸਹੀ ਤਿਆਰ ਕੀਤੇ ਪ੍ਰੋਂਪਟਸ (prompts) ਮੰਨਦੇ ਹਨ, DiscoBench ਅਸਲ ਦੁਨੀਆ ਦੀ ਉਲਝਣ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।
ਇਸ ਫਰੇਮਵਰਕ ਵਿੱਚ ਗਿਆਨ, ਰਾਜਨੀਤੀ ਅਤੇ ਸੰਗੀਤ ਸਮੇਤ ਗਿਆਰਾਂ ਖੇਤਰਾਂ ਵਿੱਚ 211 ਕਾਰਜ (tasks) ਸ਼ਾਮਲ ਹਨ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਅਸਪਸ਼ਟਤਾ ਦੇ 463 ਵਿਸ਼ੇਸ਼ ਬਿੰਦੂ ਹਨ। ਹਰ ਚੈੱਕਪੁਆਇੰਟ 'ਤੇ, ਇੱਕ ਏਜੰਟ ਨੂੰ ਇਹ ਫੈਸਲਾ ਲੈਣਾ ਪੈਂਦਾ ਹੈ ਕਿ ਕੀ ਸਰਚ ਜਾਰੀ ਰੱਖੀਏ, ਜਵਾਬ ਦਿੱਤਾ ਜਾਵੇ, ਜਾਂ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ, ਯੂਜ਼ਰ ਤੋਂ ਸਪਸ਼ਟੀਕਰਨ ਮੰਗਿਆ ਜਾਵੇ। ਮਨੁੱਖੀ ਅੰਤਰਕਿਰਿਆ ਦੀ ਨਕਲ ਕਰਨ ਲਈ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ Gemini 3 Flash ਨੂੰ ਇੱਕ LLM-ਅਧਾਰਤ ਯੂਜ਼ਰ ਸਿਮੂਲੇਟਰ ਵਜੋਂ ਵਰਤਿਆ ਤਾਂ ਜੋ ਜਦੋਂ ਕੋਈ ਏਜੰਟ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲਾ ਫਾਲੋ-ਅੱਪ ਸਵਾਲ ਪੁੱਛੇ ਤਾਂ ਇਸ਼ਾਰੇ ਦਿੱਤੇ ਜਾ ਸਕਣ।
Error Cascade: ਵਧੇਰੇ ਸਰਚ ਕਰਨਾ ਬਿਹਤਰ ਕਿਉਂ ਨਹੀਂ ਹੈ
ਅਧਿਐਨ ਇੱਕ ਖ਼ਤਰਨਾਕ ਪੈਟਰਨ ਦੀ ਪਛਾਣ ਕਰਦਾ ਹੈ: ਜਦੋਂ ਕੋਈ ਏਜੰਟ ਕਿਸੇ ਅਸਪਸ਼ਟ ਵਸਤੂ ਜਾਂ ਵਿਰੋਧੀ ਮਾਪਦੰਡਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਦਾ ਹੈ, ਤਾਂ ਉਹ ਮਦਦ ਮੰਗਣ ਦੀ ਬਜਾਏ ਅਕਸਰ "ਵਧੇਰੇ ਸਖ਼ਤ ਸਰਚ" ਕਰਨ ਦੀ ਚੋਣ ਕਰਦਾ ਹੈ। ਇਸ ਨਾਲ ਇੱਕ ਅਜਿਹੀ ਸਥਿਤੀ ਪੈਦਾ ਹੁੰਦੀ ਹੈ ਜਿੱਥੇ ਮਾਡਲ ਸਾਫ਼ ਅਤੇ ਵਿਆਕਰਣਕ ਤੌਰ 'ਤੇ ਸਹੀ ਸਰਚ ਕਰਦਾ ਹੈ, ਪਰ ਉਹ ਮੂਲ ਰੂਪ ਵਿੱਚ ਗਲਤ ਦਿਸ਼ਾ ਵਿੱਚ ਹੁੰਦੇ ਹਨ।
ਅੰਕੜੇ ਦਰਸਾਉਂਦੇ ਹਨ ਕਿ "ਵਧੇਰੇ ਸਰਚ ਕਰਨਾ" ਅਸਲ ਵਿੱਚ ਸਹੀਅਤਾ (accuracy) ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ। "SearchHeavyGuess" ਪ੍ਰੋਫਾਈਲ ਵਿੱਚ—ਜਿੱਥੇ ਮਾਡਲ ਵਾਰ-ਵਾਰ ਸਰਚ ਕਰਦੇ ਹਨ ਪਰ ਸਪਸ਼ਟੀਕਰਨ ਦੀ ਬਜਾਏ ਅੰਤ ਵਿੱਚ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦੇ ਹਨ—ਸਫਲਤਾ ਦੀ ਦਰ ਡਿੱਗ ਕੇ 51.9% ਰਹਿ ਗਈ। ਇਸ ਦੇ ਉਲਟ, ਜਿਨ੍ਹਾਂ ਮਾਡਲਾਂ ਨੇ "SearchThenAsk" ਰਣਨੀਤੀ ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਉਨ੍ਹਾਂ ਨੇ 93.4% ਦੀ ਬਹੁਤ ਉੱਚੀ ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕੀਤੀ। ਇਹ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਅਸਫਲਤਾ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਘਾਟ ਨਹੀਂ ਹੈ, ਸਗੋਂ ਸੰਵਾਦਕੀ ਏਜੰਸੀ (conversational agency) ਦੀ ਅਸਫਲਤਾ ਹੈ।
ਪ੍ਰਮੁੱਖ ਮਾਡਲਾਂ ਦੇ ਪਰਫਾਰਮੈਂਸ ਬੈਂਚਮਾਰਕਸ
ਗਿਆਰਾਂ ਉੱਚ-ਦਰਜੇ ਦੇ ਮਾਡਲਾਂ ਦੀ ਜਾਂਚ ਨੇ ਇੱਕ ਕੌੜੀ ਸੱਚਾਈ ਸਾਹਮਣੇ ਲਿਆਂਦੀ ਹੈ: ਅਸਪਸ਼ਟਤਾ ਦਾ ਸਾਹਮਣਾ ਕਰਨ 'ਤੇ ਉਦਯੋਗ ਦੇ ਮੋਹਰੀ ਮਾਡਲ ਵੀ 50% ਸਹੀਅਤਾ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਤੋੜਨ ਲਈ ਸੰਘਰਸ਼ ਕਰਦੇ ਹਨ।
- Doubao Seed 2.0 Pro 43.1% end-to-end ਸਹੀਅਤਾ ਨਾਲ ਸਭ ਤੋਂ ਅੱਗੇ ਰਿਹਾ।
- Gemini 3.1 Pro Preview 40.8% ਦੇ ਨਾਲ ਨੇੜਿਓਂ ਆਇਆ।
- Claude Opus 4.7 39.8% ਤੱਕ ਪਹੁੰਚਿਆ, ਹਾਲਾਂਕਿ ਇਸਦੀ ਚੈੱਕਪੁਆਇੰਟ ਪਾਸ ਦਰ (57%) ਵਧੇਰੇ ਸੀ।
- Qwen3.6 Max ਅਤੇ MiniMax M2.7 ਕ੍ਰਮਵਾਰ 12.3% ਅਤੇ 16.1% 'ਤੇ ਕਾਫ਼ੀ ਪਿੱਛੇ ਰਹਿ ਗਏ।
ਦਿਲਚਸਪ ਗੱਲ ਇਹ ਹੈ ਕਿ ਜਦੋਂ ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਇੱਕ "Guided" ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਦਿੱਤਾ ਜਿਸ ਵਿੱਚ ਮਾਡਲਾਂ ਨੂੰ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਅਸਪਸ਼ਟਤਾ ਵੱਲ ਧਿਆਨ ਦੇਣ ਲਈ ਕਿਹਾ ਗਿਆ ਸੀ, ਤਾਂ end-to-end ਸਹੀਅਤਾ ਸਿਰਫ 28.6% ਤੋਂ ਵਧ ਕੇ 33.7% ਹੋਈ। ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਅਸਪਸ਼ਟਤਾ ਨੂੰ "ਪਛਾਣਨਾ" ਅਤੇ "ਅੰਤਰਕਿਰਿਆ ਰਾਹੀਂ ਇਸ ਨੂੰ ਹੱਲ ਕਰਨ ਦਾ ਤਰੀਕਾ ਜਾਣਨਾ" ਦੋ ਵੱਖ-ਵੱਖ ਬੌਧਿਕ ਹੁਨਰ ਹਨ।
AI ਲੈਂਡਸਕੇਪ ਲਈ ਪ੍ਰਭਾਵ
ਇਹ ਖੋਜ ਏਜੰਟਿਕ AI ਵਿਕਾਸ ਦੇ ਫੋਕਸ ਨੂੰ ਬਦਲਦੀ ਹੈ। ਸੱਚਮੁੱਚ ਭਰੋਸੇਯੋਗ ਖੁਦਮੁਖਤਿਆਰ ਖੋਜਕਰਤਾ ਬਣਾਉਣ ਲਈ, ਉਦਯੋਗ ਨੂੰ "tool call" ਦੀ ਬਾਰ-ਬਾਰ ਵਰਤੋਂ ਵਧਾਉਣ ਤੋਂ ਅੱਗੇ ਵਧਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ interactive reasoning (ਅੰਤਰਕਿਰਿਆਤਮਕ ਤਰਕ) 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। LLM ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਲਈ ਅਗਲਾ ਮੋੜ ਸਿਰਫ ਬਿਹਤਰ ਰਿਟ੍ਰੀਵਲ (retrieval) ਨਹੀਂ ਹੈ—ਬਲਕਿ ਗੁੰਝਲਦਾਰ, ਬਹੁ-ਪੜਾਅ ਵਾਲੇ ਕਾਰਜਾਂ ਦੌਰਾਨ ਗਲਤੀਆਂ ਨੂੰ ਵਧਣ ਤੋਂ ਰੋਕਣ ਲਈ ਬਿਹਤਰ "clarification logic" (ਸਪਸ਼ਟੀਕਰਨ ਤਰਕ) ਦਾ ਵਿਕਾਸ ਕਰਨਾ ਹੈ।
ਮੁੱਖ ਨੁਕਤੇ
- ਅਸਪਸ਼ਟਤਾ ਮੁੱਖ ਅਸਫਲਤਾ ਬਿੰਦੂ ਹੈ: AI ਏਜੰਟ ਇਸ ਲਈ ਅਸਫਲ ਨਹੀਂ ਹੁੰਦੇ ਕਿਉਂਕਿ ਉਹ ਜਾਣਕਾਰੀ ਨਹੀਂ ਲੱਭ ਸਕਦੇ, ਸਗੋਂ ਇਸ ਲਈ ਕਿਉਂਕਿ ਜਦੋਂ ਕੋਈ ਕੁਐਰੀ ਅਧੂਰੀ ਹੁੰਦੀ ਹੈ ਤਾਂ ਉਹ ਸਪਸ਼ਟੀਕਰਨ ਮੰਗਣ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ।
- "Search-Heavy" ਜਾਲ: ਗਲਤ ਵਸਤੂ ਲਈ ਵਾਰ-ਵਾਰ ਸਰਚ ਕਰਨਾ ਇੱਕ ਅਜਿਹਾ "error cascade" ਪੈਦਾ ਕਰਦਾ ਹੈ ਜਿਸ ਤੋਂ ਉੱਭਰਨਾ ਸਿਰਫ਼ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਨਾਲੋਂ ਕਿਤੇ ਜ਼ਿਆਦਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ।
- Detection $\neq$ Resolution: ਉੱਚ ਡਿਟੈਕਸ਼ਨ ਸਕੋਰ (ਗਲਤੀ ਦੀ ਪਛਾਣ ਕਰਨਾ) ਆਪਣੇ ਆਪ ਉੱਚ ਸਫਲਤਾ ਦਰ ਵਿੱਚ ਨਹੀਂ ਬਦਲਦੇ, ਜੋ ਕਿ ਮਾਡਲਾਂ ਦੁਆਰਾ ਸੰਵਾਦਕੀ ਸਮੱਸਿਆ-ਸੁਲਝਾਉਣ ਦੇ ਤਰੀਕੇ ਵਿੱਚ ਇੱਕ ਕਮੀ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।
