AnthropicのOpus 5、ブラウザでのプロンプトインジェクション成功率0%を達成

AnthropicはOpus 5のリリースにより、AIセキュリティにおける記念碑的な進歩を遂げました。これは、自律型エージェントにおける最も根深い脆弱性の一つを解決する可能性があります。二層防御システムを実装することで、このモデルはブラウザベースのプロンプトインジェクション攻撃に対して、ほぼ完全な耐性を示しました。

AIエージェントにおけるプロンプトインジェクションの危機

プロンプトインジェクションは、現在のAI時代における「アキレス腱」であり続けています。この脆弱性は、攻撃者がウェブページ内に(多くの場合、不可視のテキストを通じて)悪意のある指示を隠し、AIエージェントがブラウジング中にそれを読み取ることで発生します。一度処理されると、これらの指示はモデルを乗っ取り、安全プロトコルの回避や不正なアクションの実行を強制する可能性があります。OpenAIのような業界のリーダーは、プロンプトインジェクションはLLM固有の解決不可能な欠陥である可能性を示唆してきましたが、Anthropicの最新データはその悲観的な見方に疑問を投げかけています。

成功率0%というベンチマークの達成

Anthropicのシステムカードによると、Opus 5はブラウザエージェント向けに特別に設計された129の異なるテストシナリオにおいて、驚異的な攻撃成功率0%を達成しました。これは、以前のバージョンからの大きな飛躍です。セキュリティ企業Gray Swanが実施した一般的なプロンプトインジェクションテストでは、Opus 5は前身モデルと比較して劇的な改善を示しました。15回の試行後、攻撃成功率は5.5%(Opus 4.8で観察された数値)から、わずか2.0%にまで低下しました。

このパフォーマンスにより、Opus 5はGray Swan IPIベンチマークのトップに立ち、Mythos 5 (2.6%) や Fable 5 (2.8%) といった他のハイティアモデルを上回りました。

秘訣:Auto Modeと二層防御

この画期的な成果は、モデルの知能によるものだけではなく、専用ソフトウェアとの統合によるものです。「成功率0%」は、特にClaude Coworkのような製品におけるAuto Modeの使用に結びついています。Anthropicは、エージェントを保護するために洗練された二層の防御アーキテクチャを活用しています。

  1. Pre-processing Scan(前処理スキャン): 専用のレイヤーが、メインのLLMがテキストを処理する前に、すべての入力データをスキャンして隠された指示や操作的な指示がないかを確認します。
  2. Execution Blocking(実行ブロック): 二次レイヤーがエージェントの意図されたアクションを監視し、ブラウザ環境で実行される前に、あらゆる危険なコマンドをブロックします。

興味深いことに、データはモデル単体では万能薬ではないことを示しています。これらの保護ソフトウェアレイヤーがない場合、Opus 5の脆弱性は3.7%となります。実際、特化型のSonnet 5モデルは、単体では0.93%の成功率と、わずかに優れたパフォーマンスを示します。セキュリティの閾値をほぼ完璧なレベルまで押し上げているのは、コアモデルと防御ソフトウェアスタックの相乗効果なのです。

なぜこれがAIの未来にとって重要なのか

自律型AIエージェントを構築している開発者や創業者にとって、この進展はパラダイムシフトです。もしプロンプトインジェクションが、単なるモデルのトレーニングではなく、アーキテクチャのレイヤーを通じて無効化できるのであれば、AIがメール、ブラウザ、機密データを管理するような、信頼性の高い「エージェント的(agentic)」なワークフローへの道は、より安全なものになります。Anthropicは、業界がいかにして「解決不可能」という物語を乗り越え、堅牢で実用的なAIの自律性へと向かえるかという青写真を示しました。

主なポイント

  • 業界をリードするセキュリティ: Auto Modeを利用した場合、Opus 5は129のブラウザベースのプロンプトインジェクションシナリオにおいて成功率0%を達成しました。
  • 多層防御: 前処理データスキャンとプロアクティブなアクションブロックを組み合わせた二層アプローチによってセキュリティを実現しています。
  • ベンチマークにおける優位性: Opus 5はGray Swan IPIベンチマークで首位に立ち、以前のモデルバージョンと比較して攻撃成功率を大幅に低減させました。