金融サービス企業のシニア・アプリケーション・セキュリティ・エンジニアである自分を想像してみてください。社内で開発された認証コードの断片をフロンティアAIモデルに入力し、ロジックの欠陥を特定するよう依頼します。しかし、分析の代わりに、説教が返ってきます。モデルは、あなたがその情報を「システムへの攻撃」に利用する可能性があるという理由で拒否します。あなたは犯罪者ではありません。犯罪者を阻止するために雇われた人間です。それなのに、ガードレールは両者の役割を区別できないものとして扱います。

このようなシナリオは日常的になりつつあります。大規模なAI研究所が悪用を防ぐために安全プロトコルを強化するにつれ、正当なサイバーセキュリティ専門家のワークフローと真っ向から衝突しています。その結果、あるパラドックスが生じています。ソフトウェアエンジニアリングの生産性を劇的に向上させるものとして推奨されているツールが、重要インフラを保護する専門家たちから遠ざけられているのです。

安全性とセキュリティの間の摩擦

主要なAI開発者は、サイバーセキュリティ・コミュニティを完全に無視しているわけではありません。OpenAIはTrusted Access for Cyberというプログラムを運営しています。AnthropicはCyber Verification Programを運用しています。どちらも、審査を通過したユーザーが特定の拒否メカニズムをバイパスし、正当な研究を行えるように設計されています。理論上、これらのゲートは善意の活動者と悪意のある活動者を分離するものです。

しかし実際には、多くのオフェンシブ・セキュリティ・リサーチャーやネットワーク・ディフェンダーにとって、それらは官僚的な足止めに感じられます。検証プロセスは不透明な場合があります。承認までのタイムラインも不明確です。承認された後でさえ、リサーチャーからは、権限の昇格が異なるモデルのバージョンや会話のスレッド間で常に安定して機能するわけではないという報告があります。現在進行中の攻撃に対して脆弱性の修正を急いでいるチームにとって、この摩擦は重大な問題となります。

ワシントンとシリコンバレーの間の緊張は、米国政府がAnthropicのMythosおよびFableモデルに対して輸出規制を課した際に、顕著な衝突点に達しました。この規制は、個人がモデルの安全ガードレールを回避してサイバー攻撃を容易にしたという報告を受けて行われました。規制当局は、これらのシステムを特異的に危険な輸出商品として扱うべく迅速に動きました。その後、規制は解除または修正されましたが、この出来事は明確なシグナルを送りました。つまり、高度な能力を持つAIモデルは、汎用的な技術的道具というよりも、潜在的な「終末装置」として見なされることが増えているということです。それらに依存する防御側にとって、その認識は、より厳しい監視、アクセスの遅延、そして「セキュリティ研究は単に別の名前がついたハッキングに過ぎない」という根底にある疑念へとつながります。

なぜ防御と攻撃は切り離せないのか

対立の核心は管理上の問題ではなく、技術的な問題です。ネットワークを防御するために必要な能力は、ネットワークを攻撃するために必要な能力とほぼ同一なのです。

NCC GroupのチーフサイエンティストであるChris Anleyは、シンプルな比喩を用いています。AIはハンマーです。家を建てることもできれば、窓を割ることもできます。ツール自体はその違いを知りません。サイバーセキュリティにおいて、この二面性は避けられません。実務家がモデルに「このコードを修正して」と頼むとき、その要求は防御的なアクションをトリガーします。しかし、修正を生み出す推論プロセス(安全でない関数の特定、信頼できない入力の追跡、実行フローのマッピングなど)は、必然的にその脆弱性がどのように引き起こされるかを明らかにします。その説明自体が、攻撃のためのロードマップとして機能してしまうのです。

AIの安全チームは、攻撃の疑いがあるプロンプトを拒否するようにモデルを訓練することが多いため、システムはしばしば過剰に反応します。ユーザー入力をどのようにサニタイズすべきかを尋ねるリサーチャーには回答が得られます。しかし、どのように...