Anthropic 宣布,从 8 月 14 日开始,Claude Code 将不再要求用户为每一次工具调用点击“批准”(approve)。取而代之的是,一个由 AI 驱动的风险分类器将决定哪些操作需要人工审核。一项针对 1,053 名测试人员的研究显示,97% 的点击是在未阅读提示词的情况下发生的,而该分类器捕捉到了 89% 的有害操作,而人类仅捕捉到了 13.6%。

为什么旧的“点击批准”模式效果不佳

旧的工作流强制要求人工通过点击按钮来确认每一个外部操作——例如推送代码、删除文件。在实践中,用户将对话框视为一种形式,并出于反射性地进行批准。研究数据揭示了问题所在:几乎每一次点击都是一种反射动作,而少数引起注意的真实警告却错过了大多数高风险操作。当安全门槛消失时,系统安全性就会遭到侵蚀。

新的分类器是如何工作的

Anthropic 的替代方案是一个经过训练的模型,它会评估每一个待处理的操作,并且仅在操作属于以下三类之一时才会进行中断:

  • 不可逆操作 (Irreversible) – 无法撤销的操作,例如强制推送(force-push)到代码库或删除数据库表。
  • 破坏性操作 (Destructive) – 可能擦除工作成果的大规模删除或文件覆盖。
  • 面向外部的操作 (Outward-facing) – 将代码或消息暴露给外部系统的步骤,例如开启拉取请求(pull request)或发送 Slack 通知。

如果操作不符合这些标准中的任何一项,模型将允许其自动进行,从而结束了用户经常忽略的提示信息泛滥问题。

仅依靠 AI 方法的局限性

该分类器并非万能的安全保障。它学习的是关于危害的一般概念,而非任何特定代码库的具体细节。在大多数项目中,名为 “tmp” 的文件夹可能是无害的,但在你的项目中,它可能包含关键的构建产物;模型很可能会认为它是安全的。研究中的表现并不保证在每个生产环境中都能获得相同的结果。边缘情况——尤其是涉及自定义工具或敏感基础设施的情况——仍然需要显式的权限设置或额外的监控。

用户现在需要做什么

  • 审查新的权限模式:Pro、Max 和 Team 方案将自动采用该分类器。如果你依赖自定义的权限工作流,请验证其是否仍符合你的安全策略。
  • 识别高风险操作:将你的 CI/CD 流水线和部署脚本映射到这三个触发类别中。如果默认分类器不足以应对,请调整执行不可逆或破坏性步骤的脚本,以包含显式的安全保障措施。
  • 监控分类器警报:跟踪中断的频率和准确性。早期反馈将帮助 Anthropic 微调模型,并可能促使你为特定的工作流重新启用手动确认。

后续关注点

从人类的反射性点击转向经过训练的模型,是试图弥补许多 CI 流水线中存在的安全漏洞的一次明确尝试。

来源:https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg