Makampuni yanashindana kuweka mifumo ya AI inayojitegemea (autonomous AI agents), lakini kuna pengo la hatari linalozuka kati ya majaribio ya ndani na utendaji wa ulimwengu halisi. Mashirika yanawapa mawakala uhuru zaidi huku mifumo ya usimamizi (governance frameworks) ikishindwa kutabiri makosa yanayowakabili wateja.
Tatizo la Uwiano na Uhali Halisi
Utafiti wa VentureBeat Pulse uligundua "pengo la tathmini" (evaluation gap) la kushangaza katika AI ya makampuni. Asilimia hamsini ya makampuni yalitoa mawakala wa AI au kipengele cha LLM kilichopita kila tathmini ya ndani, lakini kikashindwa mara tu mteja halisi anapowasiliana nacho.
Hali ikiwa mbaya zaidi, 24% ya makampuni hayo yaliona kushindwa huko kurudiwa, jambo linaloonyesha kutoweza kwa muda mrefu kuiga hali tata za kipekee (edge cases). Makosa mara nyingi hutokana na mnyororo wa mantiki uliovunjika (broken reasoning chains) badala ya majibu makosa ya pekee, ikionyesha kuwa vigezo vya sasa (benchmarks) vinakosa kutabiri mienendo isiyotabirika ya mifumo ya mawakala (agentic workflows).
Mgogoro wa Imani katika Tathmini za Otomatiki
Ni asilimia 5 tu ya mashirika yaliyofanyiwa utafiti yanayouamini kikamilifu tathmini za otomatiki leo. Kutokuamini huku kunatokana na kasoro mbili za kiufundi:
- Uwiano mbaya na ulimwengu halisi: 29% ya viongozi wanasema tathmini zao haziakisi kile kinachotokea hasa katika mawasiliano na wateja.
- Upendeleo na kutokuwa na uthabiti: 21% wanaripoti matokeo yaliyopinda au yasiyo thabiti kutoka kwa mifumo yao ya majaribio.
Mfumo wa tathmini (evaluation stack) umegawanyika. Makampuni mengi yanategemea pekee zana za asili kutoka kwa watengenezaji wa mifumo; 17% hayana zana maalum za tathmini kabisa. Takriban robo hinajibu ukaguzi wa ubora wa wakati halisi kwenye trafiki ya moja kwa moja, huku mengi yakibaki kugundua matatizo baada ya kuwafikia watumiaji.
Kasi ya Uhuru dhidi ya Kasi ndogo ya Uhakika
Theluthi mbili (66%) ya mashirika yanajielekeza kwenye utekelezaji wa "zero-human-in-the-loop" (bila usimamizi wa binadamu). Asilimia thumni na nne tayari huruhusu utekelezaji wa otomatiki kikamilifu kwa mawakala wenye hatari ndogo, na nyingine 33% zinatengeneza mifumo (pipelines) ili kufikia hatua hiyo ndani ya miezi kumi na miwili.
Mawakala wanapata nguvu ya kufanya maamuzi kwa kasi zaidi kuliko mifumo iliyoundwa kuwasimamia na kuwarekebisha. Soko sasa linahitaji majukwaa maalum ya ufuatiliaji (observability) na tathmini ambayo yanathibitisha uwezo wa mawakala dhidi ya tabia zisizotabirika za watumiaji wa moja kwa moja badala ya vigezo vya tuli (static benchmarks).
Mambo Muhimu ya Kuzingatia
- Kitendawili cha Mafanikio: 50% ya makampuni yalitoa mawakala waliopita majaribio ya ndani lakini wakashindwa wakati wa utendaji (production).
- Upungufu wa Imani: Ni asilimia 5 tu zinazouamini kikamilifu tathmini za otomatiki, hasa kwa sababu majaribio haya hayaendani na matokeo ya ulimwengu halisi.
- Shindano la Uhuru: 66% ya makampuni tayari yanatumia au yanapanga utekelezaji wa "zero-human-in-the-loop".
Utafiti wa VentureBeat Pulse unaonyesha kuwa nusu ya mawakala wa AI ya makampuni wanaopita majaribio ya ndani hukwama mara tu wanapokutana na mteja halisi, jambo linalosisitiza "pengo la tathmini" linalopanuka huku makampuni yakiharakisha kuelekea utekelezaji wa otomatiki kikamilifu.
Utafiti huo uliwahoji makampuni ambayo yameweka mawakala wanaotegemea LLM au yanajiandaa kufanya hivyo. Ulipata kuwa asilimia 50 ya wahojiwa walitoa mawakala waliopita kila kigezo cha ndani lakini wakashuhudia kushindwa kwao wakati wa utendaji. Asilimia nyingine 24 iliripoti kushindwa huko zaidi ya mara moja, ikithibitisha kuwa tatizo hilo ni upofu unaojirudia katika mifumo ya majaribio ya leo.
Kwa nini majaribio ya ndani yanashindwa kufikia lengo
Pengo hilo si kuhusu ufikiaji tu. Wahojiwa walionyesha kutokuendana kwa kina kati ya simulizi za maabara na changamoto za mawasiliano ya ulimwengu halisi. Makosa mara nyingi hutokana na mnyororo wa mantiki uliovunjika—hali ambapo mantiki ya ndani ya mwakala inatofautiana na matokeo yanayotarajiwa—badala ya majibu makosa ya pekee.
Mapungufu mawili ya kiufundi yanatawala malalamiko hayo:
- Uwiano mbaya na ulimwengu halisi – 29% ya viongozi walisema tathmini zao zinashindwa kuakisi kile kinachotokea hasa mteja anapowasiliana na mwakala.
- Upendeleo na kutokuwa na uthabiti – 21% walionyesha kuwa mifumo yao ya majaribio inatoa matokeo yaliyopinda au yasiyo thabiti, jambo linalopunguza imani katika vipimo wanavyotegemea.
Kikizidisha tatizo hilo, mfumo wa tathmini umegawanyika sana. Makampuni mengi yanategemea pekee zana za asili zinazotolewa na wauzaji wa mifumo, huku 17% wakikiri kuwa hawana zana maalum za tathmini kabisa. Takriban robo tu hufanya ukaguzi wa ubora wa wakati halisi kwenye trafiki ya moja kwa moja, huku mengi yakibaki kugundua matatizo baada ya tayari kuwafikia watumiaji.
Imani ni adimu
Ni asilimia 5 tu ya makampuni yaliyofanyiwa utafiti yanayosema yanaamini kikamilifu tathmini za otomatiki leo. Ukosefu wa imani ni matokeo ya moja kwa moja ya matatizo ya uwiano na upendeleo yaliyoelezwa hapo juu. Wakati seti ya majaribio isipoweza kutabiri kwa uhakika tabia ya utendaji, viongozi husita kuruhusu mawakala kufanya kazi bila usimamizi wa binadamu.
Uhuru wa mifumo unazidi uwezo wa uhakikisho
Licha ya imani ndogo katika upimaji, shinikizo la kuelekea kwenye mifumo inayojiongoza halisimami. Thuluthi mbili ya wahojiwa—66 %—wanasogea kuelekea kwenye utekelezaji wa mifumo isiyohitaji usimamizi wa binadamu (zero-human-in-the-loop). Ndani ya kikundi hicho, 34 % tayari wanaruhusu utekelezaji wa kiotomatiki kikamilifu kwa ajenti wenye hatari ndogo, na 33 % nyingine wanatengeneza mifumo (pipelines) ili kufikia hatua hiyo hiyo ndani ya miezi kumi na miwili ijayo.
Ajenti wanapata uwezo wa kufanya maamuzi kwa kasi zaidi kuliko mifumo iliyoundwa kuwatazama na kuwarekebisha. Athari yake sokoni iko wazi: mahitaji yanayoongezeka ya majukwaa maalum ya ufuatiliaji (observability) na tathmini ambayo yanaweza kuhakiki ajenti kulingana na tabia za watumiaji zinazoendelea na zisizotabirika badala ya vigezo tuli (static benchmarks).
