AI ಸರ್ಚ್ ಏಜೆಂಟ್ಗಳು ಏಕೆ ವಿಫಲವಾಗುತ್ತವೆ: ಅಸ್ಪಷ್ಟತೆಯ ನಿರ್ಣಾಯಕ ಸಮಸ್ಯೆ
ಡೆವಲಪರ್ಗಳು AI ಏಜೆಂಟ್ಗಳ ತಾರ್ಕಿಕ ಆಳವನ್ನು (reasoning depth) ಸುಧಾರಿಸುವತ್ತ ಗಮನ ಹರಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಾಯತ್ತ ಸಂಶೋಧನೆಯಲ್ಲಿನ (autonomous research) ನಿಜವಾದ ಅಡಚಣೆಯು ಸರ್ಚ್ ಸಾಮರ್ಥ್ಯವಲ್ಲ—ಅದು ಅಸ್ಪಷ್ಟತೆಯನ್ನು (ambiguity) ನಿಭಾಯಿಸುವ ಅಸಮರ್ಥತೆ. ಅತ್ಯಾಧುನಿಕ LLMಗಳು ಕೂಡ ವಿರಾಮ ತೆಗೆದುಕೊಂಡು ಸ್ಪಷ್ಟೀಕರಣವನ್ನು ಕೇಳಲು ಕಷ್ಟಪಡುತ್ತಿವೆ ಎಂದು ಹೊಸ ಅಧ್ಯಯನವು ಬಹಿರಂಗಪಡಿಸಿದೆ, ಇದು ದೀರ್ಘ ತಾರ್ಕಿಕ ಸರಪಳಿಗಳಲ್ಲಿ (reasoning chains) ಭೀಕರವಾದ "error cascade" ಗೆ ಕಾರಣವಾಗುತ್ತದೆ.
DiscoBench ಪ್ರಗತಿ
Tencent Hunyuan ಮತ್ತು Tsinghua ವಿಶ್ವವಿದ್ಯಾಲಯದ ಸಂಶೋಧಕರು DiscoBench ಅನ್ನು ಪರಿಚಯಿಸಿದ್ದಾರೆ. ಇದು ಭಾಷಾ ಮಾದರಿಗಳು (language models) ಅಸ್ಪಷ್ಟ, ಅಪೂರ್ಣ ಅಥವಾ ತಪ್ಪಾದ ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಗಳನ್ನು ಹೇಗೆ ನಿಭಾಯಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ವಿಶೇಷ ಪರೀಕ್ಷಾ ಚೌಕಟ್ಟು (test framework) ಆಗಿದೆ. GAIA ಅಥವಾ BrowseComp ನಂತಹ ಹಿಂದಿನ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಿಗಿಂತ ಭಿನ್ನವಾಗಿ, ಇವು ಪರಿಪೂರ್ಣವಾಗಿ ರೂಪಿಸಲಾದ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು (prompts) ಎದುರು ನೋಡುತ್ತವೆ, ಆದರೆ DiscoBench ನೈಜ ಪ್ರಪಂಚದ ಗೊಂದಲಗಳನ್ನು ಅನುಕರಿಸುತ್ತದೆ.
ಈ ಚೌಕಟ್ಟು ವಿಜ್ಞಾನ, ರಾಜಕೀಯ ಮತ್ತು ಸಂಗೀತ ಸೇರಿದಂತೆ ಹನ್ನೊಂದು ಕ್ಷೇತ್ರಗಳಲ್ಲಿನ 211 ಕಾರ್ಯಗಳನ್ನು ಒಳಗೊಂಡಿದೆ—ಇವುಗಳಲ್ಲಿ 463 ನಿರ್ದಿಷ್ಟ ಅಸ್ಪಷ್ಟತೆಯ ಅಂಶಗಳಿವೆ. ಪ್ರತಿ ಹಂತದಲ್ಲೂ, ಏಜೆಂಟ್ ಹುಡುಕಾಟವನ್ನು ಮುಂದುವರಿಸಬೇಕೆ, ಉತ್ತರವನ್ನು ನೀಡಬೇಕೆ ಅಥವಾ ಅತ್ಯಂತ ಮುಖ್ಯವಾಗಿ, ಬಳಕೆದಾರರಿಂದ ಸ್ಪಷ್ಟೀಕರಣವನ್ನು ಕೇಳಬೇಕೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಬೇಕು. ಮಾನವ ಸಂವಹನವನ್ನು ಅನುಕರಿಸಲು, ಸಂಶೋಧಕರು Gemini 3 Flash ಅನ್ನು LLM ಆಧಾರಿತ ಬಳಕೆದಾರ ಸಿಮ್ಯುಲೇಟರ್ ಆಗಿ ಬಳಸಿದ್ದಾರೆ, ಇದರಿಂದ ಏಜೆಂಟ್ ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಅನುಸರಣಾ ಪ್ರಶ್ನೆಯನ್ನು (follow-up question) ಕೇಳಿದಾಗ ಸುಳಿವುಗಳನ್ನು ನೀಡಬಹುದು.
Error Cascade: ಹೆಚ್ಚಿನ ಹುಡುಕಾಟ ಏಕೆ ಉತ್ತಮವಲ್ಲ?
ಈ ಅಧ್ಯಯನವು ಒಂದು ಅಪಾಯಕಾರಿ ಮಾದರಿಯನ್ನು ಗುರುತಿಸಿದೆ: ಏಜೆಂಟ್ ಅಸ್ಪಷ್ಟವಾದ ಘಟಕ ಅಥವಾ ಪರಸ್ಪರ ವಿರೋಧಾಭಾಸವಿರುವ ಮಾನದಂಡಗಳನ್ನು ಎದುರಿಸಿದಾಗ, ಅದು ಸಹಾಯ ಕೇಳುವ ಬದಲು "ಹೆಚ್ಚು ಕಠಿಣವಾಗಿ ಹುಡುಕಲು" (search harder) ನಿರ್ಧರಿಸುತ್ತದೆ. ಇದು ಮಾದರಿಯು ವ್ಯಾಕರಣಬದ್ಧವಾಗಿ ಸರಿಯಾದ ಸರ್ಚ್ಗಳನ್ನು ಮಾಡಿದರೂ, ಅವು ಮೂಲಭೂತವಾಗಿ ತಪ್ಪು ದಿಕ್ಕಿನಲ್ಲಿ ಸಾಗುವ ವಿದ್ಯಮಾನಕ್ಕೆ ಕಾರಣವಾಗುತ್ತದೆ.
"ಹೆಚ್ಚು ಹುಡುಕುವುದು" ವಾಸ್ತವವಾಗಿ ನಿಖರತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಎಂದು ದತ್ತಾಂಶವು ತೋರಿಸುತ್ತದೆ. "SearchHeavyGuess" ಪ್ರೊಫೈಲ್ನಲ್ಲಿ—ಅಂದರೆ ಮಾದರಿಗಳು ಪದೇ ಪದೇ ಹುಡುಕಾಟ ನಡೆಸುತ್ತವೆ ಆದರೆ ಸ್ಪಷ್ಟೀಕರಣ ಕೇಳುವ ಬದಲು ಅಂತಿಮವಾಗಿ ಊಹಿಸುತ್ತವೆ—ಯಶಸ್ಸಿನ ದರವು 51.9% ಕ್ಕೆ ಕುಸಿಯಿತು. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, "SearchThenAsk" ತಂತ್ರವನ್ನು ಬಳಸಿದ ಮಾದರಿಗಳು 93.4% ರಷ್ಟು ಹೆಚ್ಚಿನ ಯಶಸ್ಸಿನ ದರವನ್ನು ಸಾಧಿಸಿದವು. ಇದು ವೈಫಲ್ಯವು ಮಾಹಿತಿ ಹುಡುಕುವಿಕೆಯ ಕೊರತೆಯಲ್ಲ, ಬದಲಾಗಿ ಸಂಭಾಷಣಾ ಏಜೆನ್ಸಿಯ (conversational agency) ವೈಫಲ್ಯ ಎಂದು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
ಪ್ರಮುಖ ಮಾದರಿಗಳ ಕಾರ್ಯಕ್ಷಮತೆಯ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು
ಹನ್ನೊಂದು ಉನ್ನತ ಮಟ್ಟದ ಮಾದರಿಗಳ ಪರೀಕ್ಷೆಯು ಒಂದು ಕಹಿ ಸತ್ಯವನ್ನು ಬಹಿರಂಗಪಡಿಸಿದೆ: ಅಸ್ಪಷ್ಟತೆಯನ್ನು ಎದುರಿಸಿದಾಗ ಉದ್ಯಮದ ಮುಂಚೂಣಿಯಲ್ಲಿರುವ ಮಾದರಿಗಳು ಸಹ 50% ನಿಖರತೆಯ ಮಿತಿಯನ್ನು ದಾಟಲು ಕಷ್ಟಪಡುತ್ತಿವೆ.
- Doubao Seed 2.0 Pro 43.1% ಎಂಡ್-ಟು-ಎಂಡ್ ನಿಖರತೆಯೊಂದಿಗೆ ಮುಂಚೂಣಿಯಲ್ಲಿದೆ.
- Gemini 3.1 Pro Preview 40.8% ರೊಂದಿಗೆ ಅದರ ಬೆನ್ನಟ್ಟಿದೆ.
- Claude Opus 4.7 ಹೆಚ್ಚಿನ ಚೆಕ್ಪಾಯಿಂಟ್ ಪಾಸ್ ದರವನ್ನು (57%) ಹೊಂದಿದ್ದರೂ, 39.8% ರಷ್ಟು ನಿಖರತೆಯನ್ನು ತಲುಪಿದೆ.
- Qwen3.6 Max ಮತ್ತು MiniMax M2.7 ಕ್ರಮವಾಗಿ 12.3% ಮತ್ತು 16.1% ರಷ್ಟು ಕಡಿಮೆ ಸಾಧನೆ ಮಾಡಿ ಹಿಂದುಳಿದಿವೆ.
ಆಸಕ್ತಿದಾಯಕ ವಿಷಯವೆಂದರೆ, ಸಂಶೋಧಕರು ಮಾದರಿಗಳಿಗೆ ಅಸ್ಪಷ್ಟತೆಯನ್ನು ಗಮನಿಸಲು ಸೂಚಿಸುವ "Guided" ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ನೀಡಿದಾಗಲೂ, ಎಂಡ್-ಟು-ಎಂಡ್ ನಿಖರತೆಯು 28.6% ರಿಂದ 33.7% ಕ್ಕೆ ಅಲ್ಪ ಪ್ರಮಾಣದಲ್ಲಿ ಮಾತ್ರ ಏರಿತು. ಇದು ಅಸ್ಪಷ್ಟತೆಯನ್ನು "ಗುರುತಿಸುವುದು" ಮತ್ತು "ಸಂವಹನದ ಮೂಲಕ ಅದನ್ನು ಹೇಗೆ ಪರಿಹರಿಸಬೇಕೆಂದು ತಿಳಿಯುವುದು" ಎಂಬುದು ಎರಡು ವಿಭಿನ್ನ ಜ್ಞಾನಾತ್ಮಕ ಕೌಶಲಗಳಾಗಿವೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ.
AI ವಲಯದ ಮೇಲಿನ ಪರಿಣಾಮಗಳು
ಈ ಸಂಶೋಧನೆಯು ಏಜೆಂಟಿಕ್ AI ಅಭಿವೃದ್ಧಿಯ ಗಮನವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ನಿಜವಾದ ವಿಶ್ವಾಸಾರ್ಹ ಸ್ವಾಯತ್ತ ಸಂಶೋಧಕರನ್ನು ನಿರ್ಮಿಸಲು, ಉದ್ಯಮವು ಕೇವಲ "tool call" ಆವರ್ತನವನ್ನು ಹೆಚ್ಚಿಸುವುದನ್ನು ಮೀರಿ interactive reasoning (ಸಂವಾದಾತ್ಮಕ ತಾರ್ಕಿಕತೆ) ಮೇಲೆ ಗಮನ ಹರಿಸಬೇಕು. LLM ಆಪ್ಟಿಮೈಸೇಶನ್ನ ಮುಂದಿನ ಮೈಲಿಗಲ್ಲು ಕೇವಲ ಉತ್ತಮ ಮಾಹಿತಿ ಹುಡುಕಾಟವಲ್ಲ—ಬದಲಾಗಿ ಸಂಕೀರ್ಣವಾದ, ಬಹು-ಹಂತದ ಕಾರ್ಯಗಳ ಸಮಯದಲ್ಲಿ ತಪ್ಪುಗಳು ಹೆಚ್ಚಾಗದಂತೆ ತಡೆಯಲು ಉತ್ತಮ "clarification logic" ಅನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸುವುದಾಗಿದೆ.
ಪ್ರಮುಖ ಅಂಶಗಳು
- ಅಸ್ಪಷ್ಟತೆಯೇ ಪ್ರಮುಖ ವೈಫಲ್ಯದ ಅಂಶ: AI ಏಜೆಂಟ್ಗಳು ಮಾಹಿತಿಯನ್ನು ಹುಡುಕಲು ಸಾಧ್ಯವಾಗದ ಕಾರಣ ವಿಫಲವಾಗುತ್ತಿಲ್ಲ, ಬದಲಾಗಿ ಪ್ರಶ್ನೆಯು ಅಸ್ಪಷ್ಟವಾಗಿದ್ದಾಗ ಸ್ಪಷ್ಟೀಕರಣವನ್ನು ಕೇಳಲು ವಿಫಲವಾಗುತ್ತಿವೆ.
- "Search-Heavy" ಬಲೆ: ತಪ್ಪಾದ ಘಟಕಕ್ಕಾಗಿ ಪದೇ ಪದೇ ಹುಡುಕುವುದು ಒಂದು error cascade ಅನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ, ಇದು ಕೇವಲ ಊಹಿಸುವುದಕ್ಕಿಂತಲೂ ಸರಿಪಡಿಸುವುದು ಹೆಚ್ಚು ಕಷ್ಟಕರವಾಗಿರುತ್ತದೆ.
- Detection $\neq$ Resolution: ಹೆಚ್ಚಿನ ಡಿಟೆಕ್ಷನ್ ಸ್ಕೋರ್ಗಳು (ತಪ್ಪನ್ನು ಗುರುತಿಸುವುದು) ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಹೆಚ್ಚಿನ ಯಶಸ್ಸಿನ ದರಕ್ಕೆ ಪರಿವರ್ತನೆಯಾಗುವುದಿಲ್ಲ, ಇದು ಮಾದರಿಗಳು ಸಂಭಾಷಣಾತ್ಮಕ ಸಮಸ್ಯೆಗಳನ್ನು ಹೇಗೆ ಪರಿಹರಿಸುತ್ತವೆ ಎಂಬಲ್ಲಿನ ಅಂತರವನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.
