なぜOpenAIはAI攻撃者へと舵を切ったのか

従来のレッドチーム演習では、セキュリティエンジニアが手作業でモデルを調査する必要があり、人間の想像力に制限される、遅くてコストのかかるプロセスでした。OpenAIはこれに対し、攻撃用モデルと防御用モデルを戦わせるセルフプレイ・システム「GPT-Red」で応えました。攻撃のラウンドごとに、新しいデータが防御側に供給されます。攻撃側は失敗から学ぶことで進化のループを生み出し、人間では思いつかないようなエクスプロイト(脆弱性攻撃)のパターンを浮き彫りにします。

注目すべき数値

  • 攻撃成功率: 人間のレッドチームが13%であったのに対し、GPT-Redはテストケースの84%で成功しました。
  • モデルの堅牢化: OpenAIはGPT-Redから得られた知見をトレーニング・パイプラインに直接投入しました。その結果、GPT-5.6 Solにおけるプロンプト・インジェクションの失敗回数は、4ヶ月前にリリースされたフラッグシップ・モデルと比較して6分の1に減少しました。
  • 残留リスク: 新しい防御策を講じても、「強力な」インジェクションの約3.8%はいまだにすり抜けており、その失敗率はClaude Opus 4.5に匹敵します。

ライブデモでは、このシステムの強力さが浮き彫りになりました。GPT-RedはOpenAIのオフィス内にあるAI制御の自動販売機を操作し、人間の介入なしに商品の価格を変更したり、注文をキャンセルしたりしました。

改善がユーザーにもたらす意味

OpenAIによれば、GPT-5.6 Solは前身モデルと同等の推論速度と回答品質を維持しており、安全性を高めると有用性が損なわれるという、長年の課題であった「安全性と有用性のトレードオフ」を回避しています。

自動化されたレッドチームの限界

自動化によってすべてのリスクが消えるわけではありません。高強度のインジェクションに対して3.8%の成功率があることは、高度なセルフプレイ・システムであっても隙が残ることを示しています。

今後の注目点

  • 反復的なアップグレード: セルフプレイのループは進化し続けます。

結論

GPT-Redは、AIが同種の欠陥を見つけることにおいて人間を凌駕できることを証明し、GPT-5.6におけるプロンプト・インジェクションの失敗を、測定可能なレベルで6分の1に減少させました。この画期的な進歩は安全性と有用性のギャップを縮小させましたが、小さくとも現実的な残留リスクは依然として存在します。次の章は、OpenAIがいかにして自動化されたレッドチームの知見と外部の精査を融合させ、AIを駆使する攻撃者に対して優位性を保ち続けるかにかかっています。