Anthropicは、8月14日より、Claude Codeがすべてのツール呼び出しに対してユーザーに「承認(approve)」をクリックするよう求めるのを停止すると発表しました。代わりに、AI駆動のリスク分類器が、どの操作に人間の確認が必要かを判断します。1,053人のテスターを対象とした調査では、クリックの97%がプロンプトを読まずに行われており、分類器が有害な操作の89%を検知したのに対し、人間が検知できたのはわずか13.6%であったことが示されました。
旧来の「クリックして承認」モデルが不十分だった理由
旧来のワークフローでは、コードのプッシュやファイルの削除といった外部操作のたびに、人間がボタンをクリックして確認を強制されていました。実際には、ユーザーはダイアログを形式的なものとして扱い、反射的に承認していました。調査結果の数値はその問題を浮き彫りにしています。ほぼすべてのクリックが反射的なものであり、注意を引いた数少ない真の警告でも、ほとんどのリスクの高い操作を見逃していました。セーフティゲートが失われると、システムのセキュリティは低下します。
新しい分類器の役割
Anthropicが導入した代替手段は、保留中の各操作を評価し、操作が以下の3つのカテゴリのいずれかに該当する場合にのみ中断させる学習済みモデルです。
- Irreversible(不可逆的) – リポジトリへの強制プッシュやデータベーステーブルの削除など、元に戻せない操作。
- Destructive(破壊的) – 作業内容を消去してしまう可能性のある、一括削除やファイルの書き換え。
- Outward-facing(外部向け) – プルリクエストの作成やSlack通知の送信など、コードやメッセージを外部システムに公開するステップ。
操作がいずれの基準にも該当しない場合、モデルは自動的に続行を許可し、ユーザーが無視しがちだった大量のプロンプトの氾濫を終わらせます。
AIのみのアプローチの限界
この分類器は万能な安全装置ではありません。モデルが学習したのは「害」に関する一般的な概念であり、個別のコードベースの詳細ではありません。「tmp」という名前のフォルダは、ほとんどのプロジェクトでは無害かもしれませんが、あなたのプロジェクトでは重要なビルド成果物を含んでいるかもしれません。その場合、モデルはおそらく安全だと判断するでしょう。調査におけるパフォーマンスは、すべての本番環境で同様の結果が得られることを保証するものではありません。エッジケース、特にカスタムツールや機密性の高いインフラストラクチャが関わるケースでは、依然として明示的な権限設定や追加の監視が必要です。
ユーザーが今すべきこと
- 新しい権限モードを確認する: Pro、Max、およびTeamプランでは、分類器が自動的に適用されます。カスタムの権限ワークフローを使用している場合は、それが引き続きセキュリティポリシーに準拠しているか確認してください。
- 高リスクな操作を特定する: CI/CDパイプラインやデプロイ用スクリプトを、3つのトリガーカテゴリに当てはめて整理してください。デフォルトの分類器では不十分な場合、不可逆的または破壊的なステップを実行するスクリプトに、明示的な安全策を含めるよう調整してください。
- 分類器のアラートを監視する: 中断の頻度と正確性を追跡してください。早期のフィードバックはAnthropicによるモデルの微調整に役立ち、特定のワークフローに対して手動確認を再度有効にする判断材料となります。
今後の注目点
人間の反射的なクリックから学習済みモデルへの移行は、多くのCIパイプラインに存在していた安全性のギャップを埋めるための明確な試みです。
出典: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
