Xiaomiは、音声、画像、動画をネイティブなトークンとして扱い、105万トークンのコンテキストウィンドウを備えたオープンウェイトのマルチモーダルモデル「MiMo V2.5」をリリースしました。価格表によると、入力トークン100万件あたり0.14ドル、出力トークン100万件あたり0.28ドルとなっており、このコスト構造により、長時間の会議やビデオストリームを単一のプロンプトで実行することが可能になります。
なぜ「オープンウェイト」が重要なのか
ほとんどのマルチモーダルAIは、音声文字起こしエンジン、画像キャプション生成モデルといった個別のフロントエンドを繋ぎ合わせ、その結果得られたテキストを大規模言語モデル(LLM)に投入するという仕組みをとっています。LLMは生の波形データやピクセルデータを見ることができないため、声のトーン、間(ま)、ジェスチャーといった細かなニュアンスが失われる可能性があります。Xiaomiは、MiMo V2.5が音声や動画を直接取り込むことで、タイミング、抑揚、視覚的な手がかりを保持できると主張しています。理論上、これにより中間的な文字起こしステップを経ることなく、電話中のため息を検知したり、ホワイトボード上のスケッチを追ったり、重なり合った話者を区別したりすることが可能になります。
モデルのウェイトが公開されているため、組織は自社環境(オンプレミス)にダウンロードして実行できます。これにより、生のメディアデータをクラウドAPIに送信するという一般的な慣行を回避できます。これは、ヘルスケアや金融といった多くの規制対象セクターが、躊躇したり禁止されたりしているステップです。
技術的な主要数値
- コンテキストウィンドウ: 105万トークン。数時間の会議や長編ドキュメンタリーを1回のリクエストに収めるのに十分な容量です。
- 価格: 入力トークン100万件あたり0.14ドル、出力トークン100万件あたり0.28ドル。
- モダリティ: 音声、画像、動画、および標準的なテキスト処理。
この巨大なコンテキストウィンドウが最大の目玉です。従来のLLMは数千トークンで制限があるため、開発者は長い録音を分割したり、動画を短いクリップに分けたりする必要がありました。MiMo V2.5を使用すれば、数時間の会議であっても、分割することなく単一のプロンプトに含めることができます。
テキストエンジンの実力検証
音声および動画のパイプラインについては独立したベンチマークが行われていませんが、テキストコアについては簡易的な動作確認(sanity check)を実施しました。
- コーディング: モデルは古典的な「merge intervals(区間のマージ)」問題を解き、
O(n log n)の計算量を持つアルゴリズムを生成しました。これは、アルゴリズムの制約を理解できることを示しています。 - 推論: 多段階の数学の文章題に対し、4つの明確な計算ステップで回答し、思考の連鎖(chain-of-thought)能力を示しました。
- 構造化出力: 請求書の画像の説明が与えられた際、明細、合計、日付を含む正しくフォーマットされたJSONオブジェクトを出力しました。
マルチモーダルな経路を支えているのは同じTransformerアーキテクチャであるため、強固なテキスト基盤は重要です。言語側の能力が不足していれば、音声や動画の手がかりを融合させるモデルの能力も制限されてしまいます。
プライバシー重視のユースケース
生のメディアを社内に保持しなければならない企業は、以下のような機能を備えた、単一のセルフホスト型スタックを構想できるようになります。
- ミーティング・インテリジェンス: 録音データをサードパーティサービスに送信することなく、要約、アクションアイテムの抽出、話者の特定、感情分析を実行。
- コール・アナリティクス: ストレス、不満、またはコンプライアンスに関連するキーワードをリアルタイムで検知。
- 音声インターフェース: 声のトーンを理解し、適切な抑揚で応答できるチャットボットの構築。
- ビデオ分析: ウェビナー中のジェスチャー、スライドの切り替え、画面上の描画の認識。
3つの異なるベンダーソリューションを1つのモデルに置き換えることで、統合のオーバーヘッドを削減し、データ漏洩のリスクを低減できます。
注意事項と確認すべき点
音声および動画の機能はメーカーによる主張にとどまっており、独立した測定結果は公開されていません。導入を検討しているユーザーは、本番環境でのワークロードに投入する前に、代表的なデータセットを用いて独自のベンチマークを実施すべきです。
価格設定は透明ですが、トークン単位での課金となります。
今後の注目点
- ベンチマークの公開: 音声/動画のトークン化の品質、レイテンシ、メモリ使用量に関する第三者による評価。
- ツールエコシステム: MiMo V2.5に直接入力できる、一般的なオーディオコーデックやビデオコンテナ用のオープンソースのアダプター。
- 規制当局の反応: データプライバシー規制当局が、クラウドAPIと比較して、セルフホスト型のオープンウェイトモデルを十分な保護策と見なすかどうか。
- コミュニティによる貢献: ウェイトが公開されているため、コミュニティが特定のドメイン(例:医療の書き起こし、法的証言の記録など)向けにモデルを微調整(fine-tune)する可能性があります。
MiMo V2.5は、議論のあり方を「マルチモーダルな接着剤」から、企業のファイアウォール内で動作可能な「マルチモーダルな脳」へと進化させます。そのオープンウェイトという性質は、プライバシーを重視する組織にとっての導入障壁を下げますが、謳われているオーディオ/ビデオの忠実度については、まだ証明が必要です。第三者機関によるテストがその主張を裏付けるまでは、このモデルの最大のセールスポイントは、巨大なコンテキストウィンドウと、複数のAIサービスを単一のセルフホスト型スタックに統合できる可能性にあります。
