Xiaomi imezindua MiMo V2.5, modeli ya multimodal yenye uzito wazi (open-weight) inayochukulia sauti, picha, na video kama tokeni asilia na inatoa dirisha la muktadha (context window) la tokeni milioni 1.05. Jedwali la bei linaonyesha $0.14 kwa kila milioni ya tokeni za ingizo (input tokens) na $0.28 kwa kila milioni ya tokeni za matokeo (output tokens), muundo wa gharama unaofanya iwezekane kuendesha mikutano mirefu au mitiririko ya video katika amri (prompt) moja.
Kwa nini “open-weight” ni muhimu
AI nyingi za multimodal huunganisha sehemu mbalimbali za mbele (front-ends): injini ya kubadilisha sauti kuwa maandishi, modeli ya maelezo ya picha, kisha huingiza maandishi yanayotokana nayo kwenye modeli kubwa ya lugha (LLM). LLM haioni kamwe mawimbi ghafi (raw waveform) au data za pikseli, hivyo nuances kama vile toni, mapumziko, au ishara zinaweza kupotea. Xiaomi inadai kuwa MiMo V2.5 huchukua sauti na video moja kwa moja, ikihifadhi muda, intonasi, na ishara za kuona. Kinadharia, hii inaruhusu modeli kugundua kuhema kwa nguvu kwenye simu, kufuata mchoro kwenye ubao wa kisasa (whiteboard), au kutofautisha wazungumzaji wanaoingiliana bila hatua ya upatanishi ya kunakili maandishi (transcription).
Kwa sababu uzito (weights) wa modeli hii umewekwa wazi, mashirika yanaweza kuipakua na kuiendesha kwenye mifumo yao (on-premise). Hii inaepusha utaratibu wa kawaida wa kutuma media ghafi kwenye API za wingu (cloud APIs), hatua ambayo sekta nyingi zinazodhibitiwa—kama vile afya na fedha—zinajitaahidi au zimekatazwa kuchukua.
Takwimu kuu za kiufundi
- Dirisha la muktadha (Context window): Tokeni milioni 1.05, zinazotosha kuweka mkutano wa saa nyingi au filamu ya waraka (documentary) nzima katika ombi moja.
- Bei: $0.14 kwa kila milioni ya tokeni za ingizo, $0.28 kwa kila milioni ya tokeni za matokeo.
- Aina za data (Modalities): Sauti, picha, video, pamoja na ushughulikiaji wa maandishi ya kawaida.
Dirisha kubwa la muktadha ndilo linalovutia zaidi. LLM za kawaida zina kikomo cha tokeni elfu chache, hali inayowasilisha watengenezaji kulazimika kukata rekodi ndefu au kugawanya video katika vipande vifupi. Kwa MiMo V2.5, amri (prompt) moja inaweza kuwa na mkutano wa saa nyingi bila kuugawanya katika vipande.
Mtazamo wa kwanza wa injini ya maandishi
Ingawa mifumo ya sauti na video haijafanyiwa majaribio ya kulinganisha (benchmarking) kwa uhuru, kiini cha maandishi kilifaulu ukaguzi wa haraka:
- Uandishi wa kodi (Coding): Modelii ilitatua tatizo la asili la “merge intervals” na kuzalisha algoriti yenye utata wa
O(n log n), ikionyesha kuwa inaweza kuelewa vizuizi vya algoriti. - Ufikiri (Reasoning): Ilijibu tatizo la hisabati lenye hatua nyingi kwa hesabu nne safi, ikionyesha uwezo wa mfululizo wa mawazo (chain-of-thought).
- Matokeo yaliyopangwa (Structured output): Ikipatiwa maelezo ya picha ya ankara (invoice), ilitoa kitu cha JSON kilichopangwa kwa usahihi chenye vipengele vya mstari, jumla, na tarehe.
Msingi imara wa maandishi ni muhimu kwa sababu usanifu uleule wa transformer ndio unaounga mkono njia za multimodal. Ikiwa upande wa lugha utafeli, uwezo wa modeli kuunganisha ishara za sauti au video utakuwa mdogo.
Matumizi yanayozingatia faragha kwanza
Mashirika ambayo lazima yaweke media ghafi ndani ya mfumo wao sasa yanaweza kufikiria mfumo mmoja wa kujihost (self-hosted stack) kwa ajili ya:
- Ufahamu wa mikutano (Meeting intelligence): Muhtasari, uchimbaji wa vitendo vya kufanyiwa (action-items), utambulisho wa mzungumzaji, na uchambuzi wa hisia bila kutuma rekodi kwa huduma ya upande wa tatu.
- Uchambuzi wa simu (Call analytics): Kugundua msongo wa mawazo, kutoridhika, au maneno muhimu yanayohusiana na uzingatiaji wa sheria kwa wakati halisi.
- Viunganishi vya sauti (Voice interfaces): Kujenga chatbots zinazoelewa toni na zinaweza kujibu kwa mabadiliko ya sauti yanayofaa.
- Uchambuzi wa video (Video analysis): Kutambua ishara, mabadiliko ya slaidi, au michoro ya kwenye skrini wakati wa webinar.
Kubadilisha suluhisho tatu tofauti za watoa huduma kwa modeli moja kunapunguza gharama za uunganishaji na kupunguza maeneo ya uvujaji wa data.
Tahadhari na nini cha kuhakiki
Uwezo wa sauti na video unabaki kuwa madai ya mtengenezaji; hakuna vipimo vya huria vilivyochapishwa. Watumiaji watakaokuja wanapaswa kufanya majaribio yao wenyewe (benchmarks) kwenye seti za data zinazowakilisha hali halisi kabla ya kuanza kutumia katika kazi za uzalishaji.
Bei, ingawa ni wazi, ni kwa kila tokeni.
Nini cha kufuatilia baadaye
- Utoaji wa majaribio (Benchmark releases): Tathmini za upande wa tatu za ubora wa utengenezaji wa tokeni za sauti/video, ucheleweshaji (latency), na matumizi ya kumbukumbu (memory footprint).
- Mfumo wa zana (Tooling ecosystem): Adapta za chanzo huru (open-source) kwa codec maarufu za sauti na vibeba video (video containers) ambavyo huingiza data moja kwa moja kwenye MiMo V2.5.
- Maoni ya kisheria (Regulatory feedback): Ikiwa wasimamizi wa faragha ya data wataona modeli za open-weight zinazojihost kama kinga ya kutosha ikilinganishwa na API za wingu.
- Michango ya jamii (Community contributions): Kwa kuwa uzito (weights) uko wazi, jamii inaweza kuifanyia modeli marekebisho (fine-tune) kwa ajili ya nyanja maalum (kama vile dikteta ya matibabu, ushahidi wa kisheria).
MiMo V2.5 inasogeza mjadala kutoka kwenye “multimodal glue” kuelekea “multimodal brain” inayoweza kufanya kazi ndani ya ukuta wa moto wa shirika (corporate firewall). Asili yake ya kuwa na uzito wazi (open-weight) inapunguza vikwazo kwa mashirika yanayozingatia faragha, lakini ubora wa sauti/video uliodaiwa bado unahitaji uthibitisho. Mpaka vipimo huru vitakapothibitisha madai hayo, sifa kuu ya kuvutia ya modeli hii inabaki kuwa dirisha lake kubwa la muktadha (massive context window) na uwezekano wa kuunganisha huduma kadhaa za AI katika mfumo mmoja wa kujihostia (self-hosted stack).
