Alibaba imefunua Qwen3.8-Max, modeli ya Mixture-of-Experts (MoE) yenye vigezo (parameters) trilioni 2.4 ambayo ilipata kiwango cha mafanikio cha 86.1% kwenye kipimo cha OSWorld-Verified—Alibaba inasema alama hiyo inazidi GPT-5.6, Sol Max na Fable 5. Kipimo hiki hupima uwezo wa AI kuingiliana na mfumo wa uendeshaji (operating system), kusakinisha programu na kurekebisha makosa ya kodi (debug code), seti ya ujuzi inayounga mkono mawakala huru wa uhandisi wa programu.
Mashindano ya kuelekea mawakala huru
Modeli kubwa za lugha (Large language models) zimehama kutoka kuwa wasaidizi wa aina ya mazungumzo na kuwa zana zinazoweza kuandika, kufanya majaribio na hata kutumia kodi (deploy code). Makampuni yanayoweza kukabidhi kazi za kawaida za uhandisi kwa AI kwa uhakika yanatarajia kupunguza gharama za wafanyakazi na kuharakisha mzunguko wa bidhaa. Kipimo cha OSWorld-Verified kimekuwa kipimo halisi cha uwezo wa "agentic" kwa sababu kinahitaji zaidi ya kuzalisha maandishi tuli; kinahitaji mwingiliano wa ulimwengu halisi na mfumo.
Qwen3.8-Max inaleta nini
- Muundo wa MoE wenye vigezo 2.4 T – hadi mitandao midogo 64 ya wataalamu inaweza kutumiwa kwa kila token, usanifu ambao Alibaba inadai unapunguza gharama za kompyuta kwa takriban 40%.
- Ushughulikiaji wa maelekezo ya multimodal – modeli inakubali maandishi, picha na data zilizopangwa kwa pamoja, ikiruhusu ombi moja kuelezea UI, kuonyesha picha ya skrini (screenshot) na kutoa faili za usanidi (configuration files).
- Dirisha la muktadha la tokeni 64 k – nafasi ya kutosha kwa misingi ya kodi (codebases) kamili, faili za kumbukumbu (log files) au ripoti ndefu za kiufundi bila kuzigawa katika vipande.
Sifa hizi zinalenga mchakato wa kazi wa "end-to-end" ambao timu za programu hutumia saa nyingi: kuvuta utegemezi (dependencies), kuchanganua kumbukumbu (logs), kurekebisha hitilafu (patching bugs) na kuzalisha nyaraka.
Takwimu chini ya darubini
| Kazi | Kipimo kilichoripotiwa |
|---|---|
| OSWorld-Verified (mwingiliano wa agentic OS) | Mafanikio ya 86.1 % |
| Uzalishaji wa kodi (HumanEval-Plus) | 78.4 % ya kufaulu |
| Mantiki ya multimodal (MM-Bench) | 84.3 % |
| Muhtasari wa muktadha mrefu (jaribio la tokeni 50 k) | 90.2 % |
Takwimu zote zinatokana na majaribio ya ndani ya Alibaba. Ikiwa zitathibitika, modeli hiyo itawapa makampuni API moja inayoweza kushughulikia kodi, picha na nyaraka kubwa huku ikifanya gharama za inference kuwa ndogo kuliko washindani wengi wa modeli zenye msongamano (dense-models).
Hatari na hitaji la uhakiki huru
Ukosefu wa uhakiki kutoka kwa upande wa tatu ndio onyo la haraka zaidi. Vipimo vinaweza kurekebishwa, maelekezo (prompts) kuboreshwa au seti za majaribio kuchujwa ili kusaidia usanifu fulani. Bila marudio ya nje, dai kwamba Qwen3.8-Max "inazidi" GPT-5.6 linabaki kuwa la muda. Aidha, modeli za MoE zinaweza kuonyesha utendaji usio sawa: baadhi ya tokeni zinaweza kuelekezwa kwa wataalamu ambao hawajafundishwa vizuri, jambo linalopelekea upotofu (hallucinations) wa mara kwa mara au matokeo yasiyo thabiti—matatizo ambayo ni muhimu wakati AI inatarajiwa kubadilisha mifumo ya uzalishaji (production systems).
Nini cha kufuatilia baadaye
- Marudio huru – watafiti na wateja wa wingu (cloud) pengine wataendesha seti ile ile ya OSWorld-Verified na majaribio ya HumanEval-Plus kwenye vifaa vinavyopatikana hadharani.
- Bei na ucheleweshaji (latency) – bei ya API ya Alibaba Cloud itafichua ikiwa akiba ya 40% ya kompyuta itageuka kuwa faida halisi ya gharama kwa watengenezaji.
- Zana za usalama – kadiri mawakala huru wanavyopata udhibiti zaidi juu ya miundombinu, mfumo utahitaji mifumo ya ufuatiliaji, kurudisha nyuma (rollback) na ukaguzi ambayo bado iko katika hatua za awali.
Ikiwa Qwen3.8-Max itatimiza namba zake kuu, pengo kati ya msaidizi wa mazungumzo na roboti ya uhandisi inayojitegemea litapungua kwa kiasi kikubwa. Miezi michache ijayo inapaswa kuonyesha ikiwa utendaji wa modeli hiyo utastahimili uchunguzi na ikiwa makampuni yataitumia kama uti wa mgongo wa mifumo yao ya maendeleo iliyofanyiwa uboreshaji (automated development pipelines).
