Xiaomiの新しいMiMo-V2-Flashモデルは、3090億パラメータのMixture-of-Experts (MoE) システムであり、従来のモデルの50分の1以下の計算量で、SWE-Benchのオープンソースリーダーボードで73.4%の精度を記録し、トップに立ちました。この結果は、大規模言語モデルの研究において常態化している膨大なエネルギーコストをかけずとも、エリート級のパフォーマンスが可能であることを示しています。
なぜXiaomiはMoEを採用したのか
MoEアーキテクチャは、共有のバックボーンに多くの「エキスパート」サブネットワークを接続することで、コストを回避します。このモデルは3090億個の全パラメータを保持していますが、各トークンに対して活性化されるのは約150億個のみです。この選択的な活性化により、推論時のメモリと計算量を大幅に削減し、FP16モードで618GBのVRAMを持つ約10枚のH100 GPU上でモデルを実行することを可能にしています。
実用性を実現するエンジニアリングの工夫
- ハイブリッド・アテンション・パターン – ほとんどのレイヤーではスライディングウィンドウ・アテンションを使用し、アテンション行列を各トークンの周囲の狭い範囲に限定しています。6レイヤーごとにグローバル・アテンションに切り替えることで、メモリを爆発させることなく長距離の依存関係を捉えます。このパターンにより、メモリ使用量を6分の1に削減しています。
- 高速デコーディング・モジュール – 内蔵の予測器が1回のフォワードパスで複数のトークンを出力し、標準的な自己回帰デコーディングよりも最大2.6倍高い生成速度を実現します。
- 256Kコンテキストウィンドウ – このアーキテクチャは25万トークンの入力を処理でき、コードベース、研究論文、またはあらゆる長文ドキュメントに有用です。
これらのコンポーネントにより、3090億規模のシステムでは本来手の届かないようなハードウェアでも、モデルを使用可能な状態に保っています。
Multi-Teacher On-Policy Distillation (MOPD)
MOPDは、数学用、プログラミング用など、多くの専門的なティーチャー(教師)モデルを使用して、生徒モデルであるMiMo-V2-Flashをトレーニングします。生徒モデルが自身の回答を生成する一方で、すべてのティーチャーから同時にフィードバックを受け取ります。生徒モデルは、実際に生成するであろう分布から学習するため、蒸留(distillation)が安定し、知識転送が現実世界のタスクに集中したまま維持されます。
MOPDは、従来の手法で必要とされる計算量の50分の1以下しか消費しません。
ベンチマーク性能
| ベンチマーク | スコア |
|---|---|
| SWE-Bench (コーディング) | 73.4% |
| GPQA-Diamond (一般QA) | 83.7% |
| MMLU-Pro (マルチタスク言語理解) | 84.9% |
| Arena-Hard (敵対的チャット) | 86.2% |
残るトレードオフ
MoEによる節約があるとはいえ、MiMo-V2-Flashの実行はノートPCでできるような作業ではありません。デプロイには依然として約10枚のH100 GPUが必要であり、618GBのVRAM要件により、モデルは高速なインターコネクトを備えたデータセンター環境に限定されます。
今後の注目点
要点: MiMo-V2-Flashは、巧妙なトレーニングパイプラインとモジュール式アーキテクチャによって、長年大規模言語モデルの開発を規定してきた制御不能な計算コストをかけることなく、トップクラスのパフォーマンスを提供できることを証明しました。次のハードルは、そのパフォーマンスを、潤沢な資金を持つ研究所以外の人々にとっても手頃なものにすることです。
