OpenAIは本日、自動化されたレッドチーム・ハッカーとして機能する大規模言語モデル「GPT-Red」をリリースしました。このシステムは、同社の最新モデルであるGPT-5.6の堅牢化をすでに進めており、シミュレーション攻撃の成功率を90%以上から23%未満へと劇的に低下させています。
GPT-Redがいかにしてレッドチームの業務を自動化するか
レッドチーム・テスト(システムを意図的に破壊したり、乗っ取ったりしようとする試み)は、従来、セキュリティの専門家に依存してきました。LLMがウェブの閲覧、コードの実行、サードパーティ製サービスの呼び出しを学習するにつれ、悪用される手法は、人間のチームが調査できるスピードを上回る速さで増殖しています。
OpenAIは、研究者が「dojo」と呼ぶシミュレーション環境内で、モデルのコピー同士を戦わせる「セルフプレイ・ループ」によってこれに対処しました。このサンドボックス内では、GPT-Redが攻撃者の役割を担い、1つ以上の防御モデルがそれに抵抗します。両者は数え切れないほどのラウンドを繰り返します。各イテレーションにおいて、攻撃側はより微細な欠陥を見つけ出すことを強いられ、防御側は新しい防御策を学習します。OpenAIはこのプロセスをGPT-5.6のトレーニング・パイプラインに組み込みました。同社は、GPT-5.6をこれまでで最も堅牢なリリースであると謳っています。
新しい種類の攻撃:「偽の思考の連鎖(fake chain of thought)」
セルフプレイの実行により、驚くべき「偽の思考の連鎖(fake chain of thought)」攻撃が明らかになりました。LLMは多くの場合、最終的な回答を導き出すためのステップバイステップの推論プロセス、すなわち「思考の連鎖(chain of thought)」を出力します。GPT-Redは、そのプロセスの中に偽の項目を挿入することを学習し、モデルに「誤った前提をすでに検証済みである」と思い込ませる手法を身につけました。例えば、攻撃者はモデルに対して「1 + 1 = 3」が確認済みであると信じ込ませ、捏造された結果に基づいてシステムが出力を行うよう仕向けることができます。
この攻撃は、純粋なテキスト生成器に限定されるものではありません。外部の研究所が構築した自動販売機スタイルのエージェント「Vendy」を対象としたテストでは、GPT-Redが価格フィールドを操作したり注文をキャンセルしたりすることに成功し、この手法がユーザーのコマンドに従って動作する特化型エージェントに対しても有効であることを証明しました。
測定可能なセキュリティの向上
OpenAIは、GPT-Redを用いたトレーニングの効果を示す数値を公開しました。新しいモデルによって生成された最強の攻撃を、8月にリリースされたGPT-5に対して実行したところ、90%以上が成功しました。しかし、同じ攻撃をGPT-5.6に対して行った場合、成功率は23%未満に抑えられました。
GPT-Redと人間のレッドチーム・テスターを対決させた2025年の実験では、AIは人間よりも効率的に攻撃のバリエーションを発見・洗練させました。これは、敵対的モデルを用いることで、より短時間で脆弱性の領域をより広範囲に探索できる可能性を示唆しています。
限界と、継続的な人間による専門知識の必要性
GPT-Redは人間のセキュリティアナリストに取って代わるものではありません。攻撃者が数回のやり取りを通じて物語を構築していく「マルチターン会話攻撃」や、画像の中に悪意のあるテキストを隠す「ビジュアル・プロンプト・インジェクション」に対しては、依然として課題が残っています。OpenAIは、このモデルを第一線の調査ツールとして活用し、有望な攻撃のアイデアを提示することで、人間の専門家がそれを調査・拡張できるようにする計画です。
このツールは依然として非公開(プロプライエタリ)であるため、外部の研究者がその能力を直接テストしたり、報告された成果を検証したりすることはできません。
