Alibaba Yazindua Qwen3.8-Max: Jitu la Parameter Trilioni 2.4 kwa ajili ya AI Agents
Timu ya Qwen ya Alibaba imetangaza Qwen3.8-Max, modeli kubwa ya bendera yenye parameter trilioni 2.4 iliyoundwa kuvuka mipaka ya maelekezo rahisi ya mazungumzo (chat prompts) kuelekea uwezo wa kufikiri kwa uhuru kwa muda mrefu (long-horizon autonomous reasoning). Kwa kuzingatia mifumo ya kazi ya siku nyingi na utekelezaji wa kazi tata, modeli hii inaashiria mabadiliko makubwa kutoka kwa LLM zinazojibu tu (reactive) kuelekea AI agents zinazochukua hatua (proactive).
Kukuza Parameter kwa ajili ya Akili ya Kujitegemea
Qwen3.8-Max ni nguvu kubwa ya kiufundi, ikitumia jumla ya parameter trilioni 2.4 ikiwa na parameter bilioni 95 zinazofanya kazi kwa kila swali. Ikijengwa juu ya usanifu wa Qwen3.5, modeli hii imeboreshwa mahususi kwa kazi za "long-horizon"—malengo tata yanayohitaji AI kufanya kazi kwa uhuru kwa siku au hata wiki kadhaa.
Katika hatua muhimu kwa jamii ya open-source, Alibaba imethibitisha kuwa uzito (weights) wa daraja la Qwen-Max utapatikana hadharani wiki ijayo, ikichangamoto utawala wa modeli za kisasa kama GPT na Claude ambazo haziko wazi.
Kuthibitisha Uhuru kupitia Uandishi wa Kanuni na Utafiti
Ili kuonyesha uwezo wake wa ki-agent, Alibaba ilitoa mifano kadhaa ya matumizi yenye athari kubwa ambapo modeli hiyo ilifanya kazi bila kuingiliwa na binadamu:
- Uhandisi wa Programu (Software Engineering): Katika kipindi cha siku 16, Qwen3.8-Max ilitengeneza kifaa cha command-line cha
oh-my-clikwa uhuru. Ilisimamia masuala yake yenyewe ya GitHub, iliandika kanuni (code), ilifanya majaribio, na kutekeleza commits 265 na pull requests 127. - Urejeleaji wa Kisayansi: Ikipangiwa kazi ya kuiga matokeo ya karatasi ya "Unified Data Selection for LLM Reasoning", modeli hiyo ilitumia saa 125 za muda wa kompyuta (compute time) kuandika mistari 7,600 ya kanuni. Haikuiga tu utafiti wa awali bali iliboresha alama ya AIME24 math benchmark kwa pointi 2.7.
- Sayansi ya Data ya Ushindani: Katika Changamoto ya WWW2025 Multimodal Dialogue Intent Recognition, modeli hiyo ilifanya vizuri zaidi kuliko timu 458 kati ya 526 za binadamu, ikiongeza usahihi wake kutoka 0.60 hadi 0.853 ndani ya saa 24.
Zaidi ya Programu: Usanifu wa Chip na Uigaji wa Kifedha
Uwezo wa kufikiri wa Qwen3.8-Max unaenea hadi kwenye vifaa (hardware) na uchumi. Katika kazi ya usanifu wa mzunguko wa kireptografia (cryptographic circuit design), modeli hiyo ilipunguza hatua kwa hatua usanifu uliokuwa "mkubwa kupita kiasi" kutoka logic gates 8,298 hadi gates 678 pekee. Kwa kutumia kifaa cha OpenROAD, hii ilisababisha upungufu wa 81% katika eneo la chip ya kimwili.
Katika uigaji tata wa rejareja unaoitwa E-Commerce-Bench, modeli hiyo ilisimamia maduka mengi ya mtandaoni kupitia mwaka wa kifedha uliogawanywa. Ikianza na yuan 100,000, iliongoza mazungumzo na wasambazaji, ilitambua matapeli 152, na kusimamia usumbufu wa mnyororo wa ugavi ili kumaliza na yuan 416,252—ikiongeza mtaji wake wa awali mara nne na kufanya vizuri zaidi kuliko mshindani wa pili, GLM 5.2.
Mipaka ya Multimodal na Utawala wa Benchmark
Modeli hiyo pia inapanua mipaka ya usindikaji wa multimodal, ikiwa na uwezo wa kushughulikia nyaraka za kurasa 200 na video zinazozidi saa 100. Alibaba pia inazindua RecreationBench, benchmark inayopima uwezo wa agent kuunda upya programu zinazofanya kazi (kwenye Windows, macOS, Android, n.k.) kupitia mwingiliano wa picha na kibodi pekee, bila ufikiaji wa kanuni chanzo (source code).
Kulingana na benchmark za ndani, Qwen3.8-Max inashindana moja kwa moja na modeli za daraja la juu, ikifikia karibu au juu ya Claude Opus 4.8 na GPT-5.6 Sol katika kategoria kadhaa, ikiwa ni pamoja na alama ya uongozi ya 93 kwenye PaperBench.
Mambo Muhimu ya Kuzingatia
- Ukubwa Mkubwa: Qwen3.8-Max ina jumla ya parameter trilioni 2.4 na parameter bilioni 95 zinazofanya kazi, zilizoboreshwa kwa ajili ya mifumo ya kazi ya siku nyingi ya kujitegemea.
- Umahiri wa Ki-agent: Modeli hiyo imeonyesha uwezo wa kushughulikia uhandisi tata wa programu, uboreshaji wa usanifu wa chip, na usimamizi kamili wa kifedha kwa uhuru.
- Athari ya Open-Weight: Tofauti na modeli nyingi za kisasa, Alibaba inapanga kuachia uzito (weights) wa daraja la Qwen-Max, ikiwapa watengenezaji ufikiaji usio na kifani wa akili ya ki-agent ya kiwango cha juu.
