Microsoftは、GitHub Copilot向けの次世代コーディングモデルとしてMAI Code 1.1 Flashをリリースしましたが、初期のベンチマークと価格表を見ると、パフォーマンスとコストの両面においてDeepSeekのオープンウェイトモデルに後れを取っています。

ベンチマークの実態とプレスリリースの乖離

Microsoftのリリースノートでは、6月バージョンのMAIモデルと比較して、トークン効率が25%向上し、コストが75%削減されると謳っています。また、Copilot内の数十万もの強化学習環境でモデルをトレーニングしたことにより、「コード生存率(code survival)」が4%向上したとも強調しています。

しかし、第三者によるテスト結果は異なるものとなっています。SWE-bench Verifiedスイートにおいて、MAI Code 1.1 Flashは72.6%の合格率を記録しましたが、これはClaude Haiku 4.5(69.8%)やGPT-5.4 mini(69.2%)を僅かに上回る程度です。その優位性はわずかなものであり、単一の指標に限定されています。

その差は、実世界のコマンドラインタスクを完了するモデルの能力を測定するTerminal Bench 2.1ではさらに広がっています。ここではMAI Code 1.1 Flashが62.9%であるのに対し、DeepSeek-V4-Flash-0731は82.7%という結果を出しています。この差は、ターミナル中心のコード生成に依存する開発者にとって、無視できないほど大きなものです。

価格における懸念点

Microsoftはこの新しいモデルを「低予算向け」の選択肢として市場に投入していますが、トークン価格はそれとは異なる現実を示しています。DeepSeek-V4-Flashは入力トークン1つあたり0.14ドル、出力トークン1つあたり0.28ドルです。一方、MAI Code 1.1 Flashは入力が0.20ドル、出力が1.20ドルとなっています。Claude Haiku 4.5はそれぞれ1.00ドルと5.00ドルであり、そのプレミアムな立ち位置を裏付けています。

出力トークンコストの急激な上昇は、大規模なコードブロックを生成するあらゆるワークフローにおいて、前身モデルからのコスト削減が約束されているにもかかわらず、Microsoftのモデルがより高価な選択肢になることを意味します。大規模な開発者や企業にとって、経済的な合理性は明らかにDeepSeekに傾いています。

MAI Code 1.1 Flashの登場背景

このモデルは、Copilotスタック内のサードパーティ製サービスを、自社開発の代替品に置き換えようとするMicrosoftの広範な取り組みの一環です。Copilotの利用データから得られた膨大な強化学習データを用いてトレーニングすることで、Microsoftはユーザーの行動とモデルの改善との間のフィードバックループを強化したいと考えています。また、今回のリリースは段階的なアップグレードのパターンに従っています。6月バージョンがコスト削減策として位置づけられていたのに対し、今回のFlash版はその軌跡における次のステップとして位置づけられています。

勝者、敗者、そしてより広範な利害関係

AIコストの管理を目指す企業にとって、特にアウトプット量が多い場合には、DeepSeekの価格設定の方がより魅力的だと感じるでしょう。一方でMicrosoftは、Copilotエコシステムに対する制御力を強め、OpenAIやAnthropicといった外部プロバイダーへの収益流出を防ぐ能力を得ることになります。

Microsoftが取り得る弁明

Microsoft自身のデータは、トークン効率の向上と、SWE-benchにおける僅かな優位性を強調しています。

今後の注目点

  • 採用指標: Copilotの使用統計により、開発者が新しいデフォルトに切り替えるのか、あるいはAPI経由で代替モデルを導入するのかが明らかになるでしょう。
  • 価格調整: Microsoftの出力トークン価格が高止まりすれば、市場の圧力によって価格改定を余儀なくされる可能性があります。
  • ベンチマークの更新: ターミナルに特化したテストの新しいバージョンが登場することで、特にMicrosoftが強化学習パイプラインを洗練させるにつれて、パフォーマンスのバランスが変化する可能性があります。
  • オープンウェイトの競争: コーディング分野に新たなオープンウェイトモデルが登場することで、コストパフォーマンス競争が激化する可能性があります。

まとめ

MAI Code 1.1 Flashは、限定的なベンチマークにおいてわずかな向上をもたらすものの、ターミナルのパフォーマンスとトークンコストの両面でDeepSeekのオープンウェイトモデルに及ばず、開発者は「統合の利便性」と「純粋な効率性」のどちらを取るかという選択を迫られることになります。