Kimi K3、サイバー攻撃において米国のフロンティアモデルに後れを取る:蒸留のギャップ

英国AIセキュリティ研究所(UK AISI)と米国AI標準・イノベーションセンター(CAISI)による共同評価により、中国と米国のAIモデル間における攻撃的サイバー操作の能力に大きな差があることが明らかになった。Moonshot AIのKimi K3は有望な兆しを見せているものの、複雑なソフトウェアの脆弱性利用(エクスプロイト)やネットワーク攻撃を課された場合、米国の主要なフロンティアモデルには依然として大きく及ばない。

ExploitBench:脆弱性調査における格差

エクスプロイト開発スキルの測定において、研究者らはカーネギーメロン大学のベンチマークであるExploitBenchを使用した。これは、2023年以降にChromeのV8エンジンで見つかった41の脆弱性を対象としている。結果は、パフォーマンスの顕著な隔たりを浮き彫りにした。米国の主要モデルは平均スコア76.2%を達成したのに対し、Kimi K3は32.2%と大幅に低いスコアにとどまった。Kimi K3は中国のGLM-5.2(24.4%)を上回ったものの、最高レベルのエクスプロイトである「任意のコード実行(ACE: Arbitrary Code Execution)」には到達できなかった。

対照的に、米国のトップティアモデルは、テストされた41のタスクのうち20件でACEの達成に成功し、ターゲットシステムへの完全な制御権を獲得した。これは、Kimi K3には再現できない高度なレベルである。

「The Last Ones」によるネットワーク攻撃のシミュレーション

また、今回の評価では、4つのサブネットにわたる20のホストを含む、複雑な32ステップの企業ネットワーク攻撃のシミュレーションである「The Last Ones(TLO)」を用いてモデルのテストも行われた。このテストは、エージェントが多段階の侵入経路をナビゲートする能力を測定するために設計されている。

Kimi K3は32ステップ中平均17ステップに到達し、中程度の能力を示した。10回の試行のうち1回は攻撃パスを完遂したものの、平均28.5ステップを記録した米国モデルのような一貫性には欠けていた。この結果は、Kimi K3が防御の脆弱な企業システムに対して自律的に攻撃を行う能力はあるものの、高度で長期的な連鎖操作を実行するための、西側のフロンティアモデルのような信頼性が不足していることを示唆している。

蒸留理論(Distillation Theory):なぜ格差が存在するのか

ここで重要な疑問が残る。なぜ中国のモデルは、一般的なベンチマークで優れた性能を示すにもかかわらず、サイバー関連のタスクで後れを取るのか。報告書は、これが「蒸留(distillation)」、つまりフロンティアモデル(AnthropicのClaudeなど)による高品質な出力を学習データとして利用する手法に起因している可能性を示唆している。

もしMoonshot AIがKimi K3の学習に蒸留を利用していた場合、重要なサイバー攻撃に関するデータを見逃している可能性が高い。米国の主要モデルは、高度な攻撃的クエリをブロックする厳格なセーフティ・クラシファイア(安全性分類器)を採用している。その結果、これらのモデルの公開された出力から構築されたデータセットには、高度なエクスプロイトに必要な知識そのものが自然と欠落することになる。これが、Kimi K3が一般的なプログラミングや推論能力では西側のモデルに匹敵しながら、専門的な攻撃的サイバータスクにおいて著しく失敗する理由である。

高まる能力と持続するリスク

現在の格差はあるものの、CAISIの時系列分析によれば、米国と中国の両モデルともEloレーティングに基づいた上昇軌道にある。オープンモデルの性能格差は、2025年初頭には6〜10ヶ月あったものが、最近ではわずか4〜7ヶ月にまで縮まっている。UK AISIは、この格差の縮小は安全性を意味するものではないと警告している。オープンウェイトモデルの能力向上は、世界のサイバーセキュリティ情勢において「持続的かつ不可逆的な悪用のリスク」をもたらすものである。

主な要点

  • サイバー性能の格差: Kimi K3のExploitBenchでのスコアは32.2%であり、米国の主要モデルの平均である76.2%を大幅に下回り、任意のコード実行(ACE)の達成にも失敗した。
  • ネットワーク攻撃能力: TLOシミュレーションにおいて、Kimi K3は32ステップの攻撃パスのうち平均17ステップに到達した。これは脆弱なシステムを標的にできることを示しているが、米国のトップティアモデルのような信頼性には欠けている。
  • 蒸留の役割: サイバースキルの不足は蒸留の手法に起因している可能性がある。Claudeのようなモデルの検閲された公開出力を学習に使用すると、高度なエクスプロイトに必要な攻撃的データが欠如するためである。