Microsoftの新しいMAI-Cyber-1-Flashモデルは、CyberGymベンチマークで96%のスコアを記録し、Anthropic、Google、OpenAIの同等のセキュリティモデルを僅差で上回りました。Microsoftによると、このアプローチにより、コードレベルの欠陥の大部分を検出しつつ、企業のセキュリティエンジンコストを約半分に削減できるとのことです。

モデルの仕組み

MAI-Cyber-1-Flashは、日常的なセキュリティタスクの約90%を単独で処理できる、コンパクトでスループットの高いモデルです。Microsoftは、「スマートルーティング」またはモデル・カスケード方式を通じて、残りのより困難なケースを、より大規模で高価なモデルであるOpenAIのGPT-5.4へとルーティングします。安価なモデルが業務の大部分を担い、高価なモデルはエッジケースの課題に対してのみ呼び出されます。Microsoftはこの分割により、全体の支出を50%削減できると主張しています。

CyberGymのスコアが重要である理由

CyberGymは、ソースコード内のセキュリティ脆弱性を特定するモデルの能力を測定します。96%の合格率は、テストスイートに注入された欠陥のほぼすべてをモデルが正しく識別できることを意味します。Microsoftは、その精度とコスト削減を実現するルーティングを組み合わせることで、大規模なコードセキュリティ・パイプラインの新しい標準として位置づけています。

企業への影響

Microsoftは、毎日およそ100兆件のセキュリティシグナルを処理しています。特化型モデルを組み合わせてオーケストレーションすることで、同社はAzureの顧客に対する中心的な「セキュリティ・オーケストレーター」として機能することを目指しており、予算を爆発させることなくスケール可能な単一のサービスを提供します。もしコスト削減の主張が正しければ、組織はセキュリティ支出の相当な部分を、脅威ハンティングやコンプライアンス報告へと振り向けることができるでしょう。

考慮すべき反論

批判的な意見としては、ベンチマークの結果が、コードベース、言語、脅威ベクトルが大きく異なる現実世界の環境に必ずしもそのまま適用できるわけではないという警告があります。また、最も困難なケースを外部モデル(GPT-5.4)に依存することは、データの所在(データレジデンシー)、レイテンシ、ベンダーロックインに関する懸念も引き起こします。さらに、50%の削減という数字は、Microsoftの内部トラフィックに一致するワークロード分布を前提としており、企業によってはその影響が小さくなる可能性があります。

今後の注目点

MicrosoftはこのモデルをAzureのセキュリティサービスを通じて展開しているため、企業顧客の間での採用率が最初の具体的なテストとなるでしょう。また、データプライバシー規則によってサードパーティモデルの使用が複雑になる可能性があるヘルスケアや金融などの規制業界において、このカスケード方式が拡張されるかどうかも注目されます。

要点: MAI-Cyber-1-Flashは、ラボの外でもパフォーマンスが維持され、ルーティングのオーバーヘッドが低く抑えられれば、ハイブリッドモデル戦略によって、大幅なコスト削減を約束しつつ、トップティアに近い検出能力を提供できることを示しています。