Xiaomi telah melancarkan MiMo V2.5, sebuah model multimodal open-weight yang mengendalikan audio, imej dan video sebagai token asli serta menawarkan tetingkap konteks sebanyak 1.05 juta token. Senarai harga menyenaraikan $0.14 bagi setiap satu juta token input dan $0.28 bagi setiap satu juta token output, satu struktur kos yang menjadikannya berdaya maju untuk menjalankan mesyuarat berdurasi panjang atau penstriman video dalam satu prom.

Mengapa "open-weight" itu penting

Kebanyakan AI multimodal mencantumkan bahagian hadapan (front-end) yang berasingan: enjin teks-ke-ucapan, model kapsyen imej, kemudian memasukkan teks yang terhasil ke dalam model bahasa besar (LLM). LLM tersebut tidak pernah melihat gelombang mentah atau data piksel, jadi nuansa seperti nada, jeda atau gerak geri boleh hilang. Xiaomi mendakwa MiMo V2.5 menyerap audio dan video secara langsung, mengekalkan masa, intonasi dan petunjuk visual. Secara teori, ini membolehkan model tersebut mengesan keluhan dalam panggilan telefon, mengikuti lakaran pada papan putih, atau membezakan penutur yang bertindih tanpa langkah transkripsi perantara.

Oleh kerana pemberatan (weights) model ini dikeluarkan secara terbuka, organisasi boleh memuat turun dan menjalankannya secara on-premise. Ini mengelakkan amalan biasa menghantar media mentah ke API awan, satu langkah yang enggan atau dilarang untuk diambil oleh banyak sektor terkawal—seperti penjagaan kesihatan dan kewangan.

Angka utama teknikal

  • Tetingkap konteks: 1.05 juta token, cukup untuk memuatkan mesyuarat berjam-jam atau dokumentari penuh dalam satu permintaan.
  • Harga: $0.14 bagi setiap satu juta token input, $0.28 bagi setiap satu juta token output.
  • Modaliti: Audio, imej, video, serta pengendalian teks standard.

Tetingkap konteks yang besar menjadi daya tarikan utama. LLM tradisional dihadkan kepada beberapa ribu token sahaja, memaksa pembangun untuk membahagikan rakaman panjang atau memecahkan video kepada klip pendek. Dengan MiMo V2.5, satu prom boleh mengandungi mesyuarat berjam-jam tanpa perlu memotongnya kepada beberapa bahagian.

Pandangan pertama terhadap enjin teks

Walaupun saluran audio dan video belum diuji penanda aras secara bebas, teras teksnya telah melepasi ujian kesahihan pantas:

  • Pengkodan: Model ini menyelesaikan masalah klasik “merge intervals” dan menghasilkan algoritma dengan kompleksiti O(n log n), menunjukkan ia boleh memahami kekangan algoritma.
  • Penaakulan: Ia menjawab masalah matematik berbilang langkah dalam empat pengiraan yang kemas, menunjukkan keupayaan rantaian pemikiran (chain-of-thought).
  • Output berstruktur: Berdasarkan huraian imej invois, ia menghasilkan objek JSON yang diformat dengan betul bersama item baris, jumlah dan tarikh.

Asas teks yang kukuh adalah penting kerana seni bina transformer yang sama menyokong laluan multimodal. Jika bahagian bahasa gagal, keupayaan model untuk menggabungkan petunjuk audio atau video akan menjadi terhad.

Kes penggunaan mengutamakan privasi

Perusahaan yang mesti menyimpan media mentah secara dalaman kini boleh membayangkan satu set teknologi (stack) kendiri untuk:

  • Kecerdasan mesyuarat: Ringkasan, pengekstrakan item tindakan, atribusi penutur, dan analisis sentimen tanpa menghantar rakaman ke perkhidmatan pihak ketiga.
  • Analitik panggilan: Mengesan tekanan, kekecewaan, atau kata kunci berkaitan pematuhan secara masa nyata.
  • Antara muka suara: Membina bot sembang yang memahami nada dan boleh bertindak balas dengan infleksi vokal yang sesuai.
  • Analisis video: Mengenali gerak geri, pertukaran slaid, atau lukisan pada skrin semasa webinar.

Menggantikan tiga penyelesaian vendor yang berasingan dengan satu model dapat mengurangkan kos integrasi dan mengurangkan titik kebocoran data.

Amaran dan perkara yang perlu disahkan

Keupayaan audio dan video kekal sebagai dakwaan pengeluar; tiada ukuran bebas yang telah diterbitkan. Bakal pengguna harus menjalankan penanda aras mereka sendiri pada set data yang mewakili sebelum komited kepada beban kerja pengeluaran.

Harga, walaupun telus, adalah berdasarkan setiap token.

Apa yang perlu diperhatikan seterusnya

  • Pelepasan penanda aras: Penilaian pihak ketiga terhadap kualiti tokenisasi audio/video, kependaman (latency), dan jejak memori.
  • Ekosistem peralatan: Adaptor sumber terbuka untuk pengekod (codec) audio dan bekas (container) video popular yang disambungkan terus ke MiMo V2.5.
  • Maklum balas kawal selia: Sama ada pengawal selia privasi data melihat model open-weight kendiri sebagai perlindungan yang mencukupi berbanding API awan.
  • Sumbangan komuniti: Memandangkan pemberatan adalah awam, komuniti mungkin melakukan penalaan halus (fine-tune) pada model untuk domain khusus (cth. diktasi perubatan, deponesi undang-undang).

MiMo V2.5 melonjakkan perbincangan daripada sekadar “perekat multimodal” kepada “otak multimodal” yang boleh beroperasi di sebalik firewall korporat. Sifat pemberat terbukanya merendahkan halangan bagi organisasi yang mementingkan privasi, namun kualiti audio/video yang dijanjikan masih memerlukan bukti. Sehingga ujian bebas mengesahkan dakwaan tersebut, daya tarikan utama model ini tetap pada tetingkap konteksnya yang besar serta kemungkinan untuk menyatukan beberapa perkhidmatan AI ke dalam satu stack hos-kendiri yang tunggal.