AnthropicとOpenAIは、審査を通過したセキュリティチームが、ほとんどの安全フィルターを解除したAIモデルを利用できる新しいリサーチ・トラックをそれぞれ開設しました。Anthropicの「Cyber Verification Program」とOpenAIの「Trusted Access for Cyber」は、承認された研究者に対し、制限のないコード、プロンプト、指示を生成できる強力な言語モデルへの直接的なアクセスを提供します。この動きは、AIサプライチェーンに明確な分岐点を作るという点で重要です。つまり、一握りのインサイダーが最も脆弱なバージョンを調査できる一方で、それ以外の世界はより強力なガードレールの後ろに留まることになるのです。

なぜこれらのプログラムが登場したのか

両社は、これらの取り組みが、自社のサービスに対して武器化される可能性のある脆弱性の発見を加速させることを目的としていると述べています。管理された専門家グループに制限の少ないサンドボックスを提供することで、悪意のあるアクターがそれらを見つける前に、攻撃ベクトルを表面化させることを目指しています。このアプローチは、開発者が特定の対象に向けて「バグバウンティ(脆弱性報奨金制度)」用のビルドをリリースする、従来のソフトウェアセキュリティの手法を反映しています。

防御者にとっての新たなリスク計算

その裏返しとして、すべての組織が「研究者」と「ハッカー」の間に境界線を引くことを余儀なくされる、二層構造のアクセスモデルが生じます。その境界線自体が、潜在的な攻撃対象領域(アタックサーフェス)となります。攻撃者が資格情報を盗んだり、内部者のアクセス権を悪用したり、審査プロセスを欺いたりした場合、ほとんどのユーザーを保護しているガードレールをすり抜けることができてしまいます。一度内部に入れば、制限のないモデルは以下のような用途に利用される恐れがあります。

  • 検知を回避するフィッシングスクリプトの生成
  • 詳細なコードスニペットを用いたゼロデイエクスプロイトの作成
  • 特定のターゲットに合わせてカスタマイズされた、説得力のあるソーシャルエンジニアリング用プロンプトの作成

AIの出力は常にフィルタリングされているという前提で防御を構築してきたセキュリティチームは、その前提を再考する必要があります。

防御者がどのように対応すべきか

  • プログラムを脅威ベクトルとして扱う。 攻撃者が審査パイプラインへの侵入を試みると想定し、AIプラットフォームにおける異常なログインパターンを監視してください。
  • クラウドを超えて検知を拡大する。 送信トラフィック、特に特権アカウントからのAI生成コードやテキストを特定してください。
  • ポリシー制御を強固に組み込む。 外部AIサービスの内部利用に対して厳格な「最小権限」ルールを適用し、侵害された資格情報から到達可能な環境をセグメント化してください。
  • ベンダーと連携する。 AnthropicやOpenAIのセキュリティ連絡窓口との連携を維持し、アクセス基準の変更や発見された悪用に関するアラートを受け取れるようにしてください。

反論

推進派は、深く調査するための安全なチャネルがなければ、脆弱性は実際に悪用されるまで隠れたままになるだろうと主張しています。したがって、これらのプログラムは欠陥を早期に表面化させることで、全体的な攻撃対象領域を減少させる可能性があります。トレードオフとして、「ガードが緩い」層は、機会主義的な悪用を招くリスクがあります。

注視すべき点

  • 両社による審査プロセスの更新
  • プログラムに起因する悪用の報告
  • AI関連の攻撃対象領域のカタログ化における業界全体の変化

結論として、新しいリサーチ・トラックはセキュリティ研究者に強力なツールを提供しますが、同時に、ゲートをすり抜けることができた者にも同じツールを渡すことになります。防御チームは、これらのプログラムを洞察の源であると同時に、新たな攻撃経路としても扱う必要があります。