研究者たちは、暗号化された推論トレース(会話をモデル間で移行させるためにプロバイダーがユーザーのデバイスに送信する小さなパケット)が、同じサービスのより低性能なモデルによって復号され、数百もの認証情報やプライベートな詳細情報が流出する可能性があることを示しました。論文『Stealing Reasoning Traces from Proprietary LLM APIs』で詳述されたこの発見は、Anthropic、OpenAI、GoogleがAIチャットをスムーズに保つために依存している利便性の高い機能に対する脅威となります。
なぜ暗号化ブロックが存在するのか
大規模言語モデル(LLM)と対話するとき、サービスは「推論トレース(reasoning trace)」を構築します。これは、回答に至るまでの内部プロンプト、ツール呼び出し、思考の連鎖(chain-of-thought)のステップの連鎖です。この連鎖を失うことなく、より大きなモデルからより安価なモデルへと切り替えられるようにするために、プロバイダーはトレースを暗号化してデバイスに送り、次のリクエスト時にそれを送り返すことを期待しています。この暗号化は、セッションやモデルをまたいだ継続性を可能にしつつ、トレースのプライバシーを維持することを目的としています。
攻撃の仕組み
研究者たちは、強力なモデル自体を侵害する必要のない、3段階の攻撃手法を実証しました。
- キャプチャ: 通常の会話中に強力なモデルによって生成された暗号化された推論ブロックをキャプチャする。
- 入力: そのブロックを同じプロバイダーのより低性能なモデルに送り、ブロックを「読み取る」よう指示する。
- 出力: 低性能なモデルは同じ復号鍵を共有しているため、復号された内容をプレーンテキストとして出力する。
低性能なモデルが「復号オラクル(decryption oracle)」として機能します。攻撃者は強力なモデルの内部には一切触れておらず、単にプロバイダー自身のAPIを自らに向けて利用しただけなのです。
研究者が回収したもの
- 182件の認証情報 – トレースに埋め込まれたAPIキー、トークン、その他の機密情報。
- 367件の個人情報 – チャット中にユーザーが提供した名前、メールアドレス、住所など。
- プロンプトインジェクションのペイロード – 暗号化されたブロック内に隠された悪意のある指示で、トレースが再再生されたときに実行される可能性があります。
- セーフティフィルターの回避 – 復号されたトレースには、プレーンテキストで確認された場合にはブロックされていたはずのステップが含まれており、有害なコンテンツがすり抜けることを可能にしていました。
論文では、この脆弱性は暗号アルゴリズムの欠陥ではなく、暗号化自体は維持されていると強調されています。侵害の原因は、ユーザー体験のためにプロバイダーのフリート内のどのモデルでもブロックを復号できるようにした設計上の選択にあります。
問題の核心にあるトレードオフ
プロバイダーがこの「モデル切り替え」機能をAPIに組み込んだのは、開発者やエンドユーザーが継続性を重視しているからです。もし暗号化が単一のモデルインスタンスやセッションに紐付けられていれば、スムーズな引き継ぎが壊れ、開発者は自前でステート管理を再構築しなければならなくなります。論文は、柔軟性のためにセキュリティが意図的に犠牲にされたと主張しています。
開発者が今すべきこと
- 暗号化されたトレースをプレーンテキストとして扱う。それらを保存するログ、キャッシュ、または監視システムは、攻撃者によって読み取られる可能性があると想定してください。
- トレースを公開リポジトリにコミットしない。たった一つの不用意なブロックでも、数十の機密情報を露呈させる可能性があります。
- より厳格な制御に備える。プロバイダーがセキュリティを強化する可能性があり、それによってマルチモデルエージェントの構築方法が変わる可能性があります。
- 明示的なステートの受け渡しに移行する。隠れた推論に頼るのではなく、暗号化なしでモデル間で安全に渡せる構造化データ(JSON、XMLなど)を出力するようにエージェントを設計してください。
- プロンプトを監査する。推論チェーンに含まれてしまう機密データがないか確認し、リクエストを送信する前にそれを取り除いてください。
大手プロバイダーの動向
この論文の発表により、Anthropic、OpenAI、Googleは、APIに組み込まれた復号ポリシーの再評価を迫られることになるでしょう。
より広範な影響
この発見は、古典的なセキュリティのジレンマを浮き彫りにしています。利便性はしばしばバックドアを開いてしまいます。ユーザーが所有するブロックをどのモデルでも復号できるようにすることで、プロバイダーは攻撃者に機密データへの低コストな経路を与えてしまいました。修正によりAIの統合は少し煩雑になるかもしれませんが、暗号化されたデータは暗号化されたまま維持されるという期待を取り戻すことにもなるでしょう。
まとめ: 暗号化された推論トレースはセキュリティ境界ではありません。それは、あなたに対して牙を剥く可能性のある利便性のためのショートカットです。それらをプレーンテキストとして扱い、ログから削除し、元のモデルのみが自身の思考を読み取れる未来に耐えられるよう、エージェントを再設計してください。
