Xiaomi imezindua MiMo-V2.5, modeli ya multimodal yenye uzito wazi (open-weight) inayochukulia sauti, picha, na video kama tokeni asilia. Inatoa dirisha la muktadha (context window) la tokeni 1,050,000 na bei ya kulipia unachotumia ya $0.14 kwa kila milioni ya tokeni za kuingiza (input) na $0.28 kwa kila milioni ya tokeni za kutolea (output), ikilenga mashirika yanayohitaji AI ya ndani (on-premise) inayotumia vyombo vya habari kwa wingi.
Kwa nini mbinu mpya ya multimodal ni muhimu
Mifumo mingi ya multimodal iliyopo hufanya njia ya mkato. Kwanza, huendesha injini ya kubadilisha sauti kuwa maandishi (speech-to-text), kisha modeli ya uoni (vision model) inayobadilisha picha kuwa maelezo, na hatimaye huingiza maandishi yaliyopatikana kwenye modeli kubwa ya lugha (LLM). LLM haioni kamwe mawimbi ya sauti ya asili au data ya piksel, hivyo nuances kama vile kuhema, kupumzika, mtikisiko wa uso, au ishara ya mkono hupotea. MiMo-V2.5 inaepuka njia hiyo ya mkato: inachukua sauti na video moja kwa moja kama "tokeni," ikihifadhi muda, toni, na ishara za kuona ambazo nakala ya maandishi (transcript) haiwezi kunasa.
Upeo wa kiufundi
- Dirisha la tokeni: tokeni 1,050,000 – zinatosha kuchukua rekodi za mikutano za saa nyingi bila kuzigawanya katika vipande vidogo.
- Kujiendesha (Self-hosting): Weka modeli kwenye seva za kampuni yenyewe, ili vyombo vya habari vya asili visitoke nje ya eneo la kampuni.
- Bei: $0.14 kwa kila milioni ya tokeni za kuingiza, $0.28 kwa kila milioni ya tokeni za kutolea – gharama inayoeleweka inayoongezeka kulingana na matumizi.
Katika ukaguzi wa haraka wa kiini cha maandishi pekee, modeli hiyo ilitatua tatizo la kodi la "merge-interval" kwa kutumia algoriti ya O(n log n) inayotarajiwa, ilipiga hesabu ya kiwango cha kujaza tanki hatua kwa hatua, na ilitoa data ya JSON kutoka kwenye ankara bila makosa. Mifumo ya sauti na video haikutumika katika jaribio hilo.
Nani atafaidika
Viwanda vinavyozingatia sana faragha kama vile afya na fedha haviwezi kutuma sauti au video asilia kwa API za upande wa tatu. Kwa kuweka data nyuma ya ukuta wa ulinzi (firewall), MiMo-V2.5 inaruhusu mashirika haya kuzingatia sheria za ulinzi wa data huku yakipata maarifa yanayoendeshwa na AI. Matumizi yanayoweza kujumuisha:
- Ufahamu wa mikutano: Changanua rekodi nzima za video ili kuibua maamuzi, mambo ya kufanyia kazi, na hisia za mzungumzaji bila hatua ya ziada ya kunakili maandishi.
- Uchambuzi wa kituo cha simu: Tambua kukasirika, kusita, au kujiamini katika sauti ya mpigaji simu kwa wakati halisi.
- Misaidizi wa kwenye kifaa: Jenga mifumo ya sauti inayoelewa toni na kuitikia ishara zisizo za maneno bila kutuma sauti kwenye wingu (cloud).
Vikwazo vya kivitendo
Ahadi ya MiMo-V2.5 inategemea utendaji wa encoders zake za sauti na video – vipengele ambavyo mwandishi bado hajavipima. Makampuni lazima yathibitishe ucheleweshaji (latency), usahihi, na matumizi ya vifaa kwa kutumia data zao wenyewe kabla ya kuanza kutumia katika uzalishaji. Timu zinazohitaji maandishi pekee huenda zitaona modeli ndogo ya maandishi pekee kuwa na ufanisi zaidi katika hesabu na gharama. Asili ya MiMo-V2.5 kuwa na uzito wazi (open-weight) inamaanisha kuwa kodi na uzito (weights) vinapatikana hadharani; hii inaruhusu urekebishaji wa kina lakini pia inahitaji utaalamu
