Kwa Nini Wakala wa Utafutaji wa AI Wanashindwa: Tatizo Muhimu la Utata
Wakati watengenezaji wakijikita katika kuboresha kina cha uwezo wa kufikiri (reasoning depth) wa wakala wa AI, kikwazo halisi katika utafiti wa kiotomatiki si uwezo wa kutafuta—bali ni kutoweza kushughulikia utata. Utafiti mpya unaonyesha kuwa hata mifumo ya LLM ya hali ya juu zaidi inapata shida kusimama na kuomba ufafanuzi, jambo ambalo mara nyingi husababisha "mfululizo wa makosa" (error cascade) katika mnyororo mrefu wa ufikiri.
Ugunduzi wa DiscoBench
Watafiti kutoka Tencent Hunyuan na Chuo Kikuu cha Tsinghua wameanzisha DiscoBench, mfumo maalum wa majaribio ulioundwa kutathmini jinsi mifumo ya lugha inavyoshughulikia maswali ya watumiaji yaliyo na utata, yasiyokamilika, au yasiyo sahihi. Tofauti na viwango vya awali kama GAIA au BrowseComp, ambavyo vinachukulia kuwa maelekezo (prompts) yameandaliwa kikamilifu, DiscoBench inaiga vurugu za ulimwengu halisi.
Mfumo huu unajumuisha kazi 211 katika nyanja kumi na moja—ikiwemo sayansi, siasa, na muziki—yenye maeneo 463 mahususi ya utata. Katika kila hatua, wakala lazima aamue ikiwa ataendelea kutafuta, atoe jibu, au, jambo la muhimu zaidi, amuombe mtumiaji ufafanuzi. Ili kuiga mwingiliano wa binadamu, watafiti walitumia Gemini 3 Flash kama msimulizi wa mtumiaji anayeendeshwa na LLM ili kutoa vidokezo wakati wakala anapouliza swali la ziada lenye ubora wa juu.
Mfululizo wa Makosa: Kwa Nini Kutafuta Zaidi Hakumaanishi Kuwa Ni Bora
Utafiti huo unatambua mfumo hatari: wakati wakala anapokutana na kitu chenye utata au seti ya vigezo zinazopingana, mara nyingi huchagua "kutafuta kwa bidii zaidi" badala ya kuomba msaada. Hii husababisha hali ambapo mfano unatekeleza utafutaji safi na wenye usahihi wa kisarufi lakini ambao kimsingi umeelekezwa upande usio sahihi.
Takwimu zinaonyesha kuwa "kutafuta zaidi" kunaweza kupunguza usahihi. Katika wasifu wa "SearchHeavyGuess"—ambapo mifumo inatafuta mara kwa mara lakini mwishowe inakisia badala ya kutafuta ufafanuzi—viwango vya mafanikio vilishuka hadi 51.9%. Kinyume chake, mifumo iliyotumia mkakati wa "SearchThenAsk" ilifikia kiwango cha juu zaidi cha mafanikio cha 93.4%. Hii inathibitisha kuwa kushindwa huku si ukosefu wa upatikanaji wa habari, bali ni kushindwa kwa uwezo wa kuwasiliana (conversational agency).
Viwango vya Utendaji vya Mifumo Inayoongoza
Kujaribu mifumo kumi na moja ya daraja la juu kulifichua ukweli mchungu: hata viongozi wa sekta wanapata shida kuvuka kizingiti cha usahihi cha 50% wanapokabiliwa na utata.
- Doubao Seed 2.0 Pro iliongoza kwa usahihi wa 43.1% wa mwisho hadi mwisho (end-to-end).
- Gemini 3.1 Pro Preview ilifuata kwa karibu ikiwa na 40.8%.
- Claude Opus 4.7 ilifikia 39.8%, licha ya kuwa na kiwango cha juu cha kupita hatua (checkpoint pass rate) cha 57%.
- Qwen3.6 Max na MiniMax M2.7 zilichelewa sana zikiwa na 12.3% na 16.1%, mtawala.
Inashangaza kwamba, hata wakati watafiti walitoa maelekezo ya mfumo ya "Guided" yaliyoiambia mifumo waziwazi kuwaichunguza utata, usahihi wa mwisho hadi mwisho uliongezeka kidogo tu kutoka 28.6% hadi 33.7%. Hii inadokeza kuwa "kutambua" utata na "kujua jinsi ya kuutatua kupitia mwingiliano" ni ujuzi miwili tofauti wa kiakili.
Athari kwa Sekta ya AI
Utafiti huu unabadilisha mwelekeo wa maendeleo ya AI ya wakala (agentic AI). Ili kujenga watafiti wa kiotomatiki wa kuaminika kweli, sekta lazima iende mbali zaidi ya kuongeza masafa ya "tool call" na ijikite katika uwezo wa kufikiri kwa mwingiliano (interactive reasoning). Mpaka unaofuata wa uboreshaji wa LLM si upatikanaji bora tu wa habari—bali ni maendeleo ya "mantiki bora ya ufafanuzi" ili kuzuia makosa yasizidi kuwa makubwa wakati wa kazi tata za hatua nyingi.
Mambo Muhimu ya Kuzingatia
- Utata ndio sababu kuu ya kushindwa: Wakala wa AI hushindwa si kwa sababu hawawezi kupata habari, bali kwa sababu wanashindwa kuomba ufafanuzi wakati swali halijabainishwa vizuri.
- Mtego wa "Search-Heavy": Kutafuta mara kwa mara kitu kisicho sahihi kunatengeneza mfululizo wa makosa ambao ni vigumu kuurekebisha kuliko kukisia tu.
- Utambuzi $\neq$ Utatuzi: Alama za juu za utambuzi (kubaini kosa) hazitafsiriwi moja kwa moja kuwa viwango vya juu vya mafanikio, jambo linaloonyesha pengo katika jinsi mifumo inavyoshughulikia utatuzi wa matatizo kupitia mazungumzo.
