Xiaomiは、音声、画像、動画をネイティブなトークンとして扱うオープンウェイトのマルチモーダルモデル「MiMo-V2.5」をリリースしました。1,050,000トークンのコンテキストウィンドウを備え、従量課金制で入力トークン100万件あたり0.14ドル、出力トークン100万件あたり0.28ドルという価格設定となっており、オンプレミスでのメディア集約型AIを必要とする組織をターゲットにしています。
なぜ新しいマルチモーダル・アプローチが重要なのか
既存のマルチモーダルシステムの多くは、本来のプロセスを回避しています。まず音声文字起こしエンジンを実行し、次に画像をキャプションに変換するビジョンモデルを実行し、最後に得られたテキストを大規模言語モデル(LLM)に投入するという手順を踏んでいます。LLMは元の音波やピクセルデータを直接見ることはないため、ため息、間、顔のひきつり、あるいは身振り手振りといったニュアンスが失われてしまいます。MiMo-V2.5はこの回り道を回避します。音声や動画を直接「トークン」として取り込むことで、書き起こしでは捉えきれないタイミング、トーン、視覚的な手がかりを保持します。
技術的な仕様
- トークンウィンドウ: 1,050,000トークン — 数時間に及ぶ会議の録音を分割することなく取り込める容量です。
- セルフホスティング: 企業の自社サーバーにモデルをデプロイできるため、生のメディアデータが敷地外に出ることはありません。
- 価格設定: 入力トークン100万件あたり0.14ドル、出力トークン100万件あたり0.28ドル — 使用量に応じて変動する透明性の高いコストです。
テキストのみのコア機能に関する簡易的な動作確認(サニティチェック)では、このモデルは期待通りの O(n log n) アルゴリズムを用いて古典的な「区間のマージ(merge-interval)」コーディング問題を解決し、タンクの充填率に関する数学問題をステップバイステップで計算し、請求書からエラーなくJSONペイロードを抽出しました。なお、このテストでは音声および動画のパイプラインは使用していません。
どのような層が恩恵を受けるか
ヘルスケアや金融といったプライバシーを重視する業界では、生の音声や動画をサードパーティのAPIに送信することはできません。MiMo-V2.5はデータをファイアウォールの背後に保持することで、これらの組織がデータ保護規則を遵守しながら、AIによるインサイトを得ることを可能にします。想定される用途には以下が含まれます:
- ミーティング・インテリジェンス: 動画の録画全体を分析し、別途文字起こしを行うことなく、決定事項、アクションアイテム、話者の感情を抽出します。
- コールセンター分析: 通話者の声に含まれる苛立ち、ためらい、あるいは自信をリアルタイムで検知します。
- オンデバイス・アシスタント: 音声をクラウドに送信することなく、トーンを理解し、非言語的な手がかりに反応する音声インターフェースを構築できます。
実用化に向けた課題
MiMo-V2.5の将来性は、音声および動画エンコーダーの性能にかかっていますが、著者はまだこれらのコンポーネントのベンチマークを実施していません。企業は本番環境への導入を決定する前に、独自のデータセットを用いてレイテンシ、精度、およびハードウェア消費量を検証する必要があります。テキストのみを必要とするチームにとっては、より小規模なテキスト専用モデルの方が、計算リソースとコストの両面で効率的である可能性が高いでしょう。MiMo-V2.5はオープンウェイトであるため、コードとウェイトが公開されています。これにより高度なカスタマイズが可能になりますが、一方でスタックを維持・保護するための社内専門知識も求められます。
まとめ
MiMo-V2.5は、ネイティブなメディア・トークン化、巨大なコンテキストウィンドウ、そして明確なトークン単価でのセルフホスティングを提供します。生の音声や動画を社内で保持しなければならないプライバシーに敏感な組織にとって、これは実現可能なパイロット・パスとなります。実社会における価値は、エンタープライズ・ワークロード下での音声・動画エンコーダーのパフォーマンス、およびセルフホスティングの運用オーバーヘッドが既存のAIチームのスキルセットに適合するかどうかにかかっています。
