Mtindo mpya wa Xiaomi wa MiMo-V2-Flash, mfumo wa mixture-of-experts (MoE) wenye vigezo (parameters) bilioni 309, sasa unaongoza kwenye orodha ya viongozi ya chanzo huru (open-source leaderboard) kwenye SWE-Bench kwa usahihi wa 73.4 % huku ukitumia chini ya 1/50 ya nguvu ya kompyuta (compute) inayohitajika na mifumo inayolingana nayo. Matokeo haya yanaonyesha kuwa utendaji wa hali ya juu unawezekana bila gharama kubwa za nishati ambazo zimekuwa kawaida katika utafiti wa mifumo mikubwa ya lugha (large-language-model).

Kwa nini Xiaomi iligeukia MoE

Muundo wa MoE huepuka gharama kwa kuunganisha mitandao midogo mingi ya "wataalamu" (expert sub-networks) kwenye mfumo mkuu wa pamoja (shared backbone). Mtindo huu huhifadhi vigezo vyote 309 B lakini huamsha takriban vigezo 15 B pekee kwa kila token. Uamshaji huu wa kuchagua hupunguza kwa kiasi kikubwa kumbukumbu ya uchakataji (inference memory) na nguvu ya kompyuta, hali inayoruhusu mtindo huu kufanya kazi kwenye takriban GPU kumi za H100 zenye VRAM ya GB 618 katika hali ya FP16.

Mbinu za kihandisi zinazofanya iwe rahisi kutumia

  • Hybrid attention pattern – Tabaka nyingi hutumia sliding-window attention, ikizuia upatanishi (attention matrix) katika eneo finyu karibu na kila token. Kila tabaka la sita hubadilika kwenda global attention, ikinasa utegemezi wa mbali (long-range dependencies) bila kuongeza matumizi makubwa ya kumbukumbu. Mfumo huu hupunguza matumizi ya kumbukumbu kwa mara sita.
  • Fast decoding module – Kifaa cha utabiri kilichojengwa ndani hutoa token nyingi katika hatua moja ya mbele (single forward pass), kikitoa kasi ya uundaji ya hadi mara 2.6 zaidi kuliko decoding ya kawaida ya autoregressive.
  • 256 K context window – Muundo huu unaweza kupokea ingizo la robo milioni ya token, jambo ambalo ni muhimu kwa misingi ya kodi (codebases), karatasi za utafiti, au hati yoyote ndefu.

Vipengele hivi vinaufanya mtindo huu uweze kutumika kwenye vifaa ambavyo vingeweza kuwa vigumu kufikiwa kwa mfumo wa kiwango cha 309 B.

Multi-Teacher On-Policy Distillation (MOPD)

MOPD hufundisha mtindo mwanafunzi—MiMo-V2-Flash—ukitumia walimu wengi waliobobea: mmoja kwa hisabati, mwingine kwa programu, na kadhalika. Wakati mwanafunzi anapozalisha majibu yake mwenyewe, anapokea mrejesho kutoka kwa walimu wote kwa wakati mmoja. Kwa sababu mwanafunzi anajifunza kutoka kwenye usambazaji (distribution) ambao atazalisha kweli, mchakato wa distillation unabaki kuwa thabiti na uhamishaji wa maarifa unabaki umejikita kwenye kazi za ulimwengu halisi.

MOPD hutumia chini ya 1/50 ya nguvu ya kompyuta inayohitajika na mbinu za kizamani.

Utendaji wa Benchmark

Benchmark Alama
SWE-Bench (coding) 73.4 %
GPQA-Diamond (general QA) 83.7 %
MMLU-Pro (multitask language understanding) 84.9 %
Arena-Hard (adversarial chat) 86.2 %

Mapungufu yanayobaki

Hata kwa akiba ya MoE, kuendesha MiMo-V2-Flash si jambo rahisi la kufanya kwenye laptop. Utekelezaji bado unahitaji takriban GPU kumi za H100, na hitaji la VRAM ya GB 618 linaufunga mtindo huu kwenye mazingira ya kituo cha data (data-center) yenye viunganishi vya kasi ya juu.

Nini cha kufuatilia baadaye

Muhtasari: MiMo-V2-Flash inathibitisha kuwa mifumo ya mafunzo ya kijanja na miundo ya kimaadi (modular architectures) inaweza kutoa utendaji wa hali ya juu bila gharama kubwa za kompyuta ambazo zimekuwa zikifafanua maendeleo ya mifumo mikubwa ya lugha kwa miaka mingi. Kikwazo kinachofuata ni kufanya utendaji huo uwe na gharama nafuu kwa mtu yeyote nje ya maabara zenye ufadhili mkubwa.