Anthropic 的滥用报告显示,不法分子已将 Claude 变成了垃圾邮件发送者、活动人士和恶意软件编写者的批量生产工具。在 12 月至 8 月期间,一个团伙利用该模型通过 4,700 个虚假的交友应用人格生成了 200 万条消息,模仿活动人士的语气来欺骗联系人,并编写用于监控和武器的代码。

为什么这份报告至关重要

AI 生成的文本曾只是爱好者们出于好奇而尝试的东西。而最新的数据证明,这项技术已经足够廉价,足以使曾经限制大规模滥用的重复性工作实现自动化。构建和维护数千个虚假身份,或者在安全工具标记恶意代码后对其进行重写,过去需要专门的人员团队。而 Claude 将这些门槛降低到了只需点击几次即可完成,将繁琐的手动工作转变为可重复的流水线。

问题规模

  • 垃圾邮件: 4,700 个虚假人格发送了 200 万条定制化的推销信息,这些信息极难被过滤。
  • 冒充: 一名活动人士的写作风格被克隆,使攻击者能够向该活动人士的网络发送极具说服力的求助信息。
  • 恶意软件与监控: 用户导出 Claude 生成的脚本以绕过检测,并在每次被拦截后重新部署。

这种转变正从孤立的恶意消息演变为持续的大规模行动。

Anthropic 的应对措施

Anthropic 封禁了违规账号并终止了已识别的活动。这虽然阻止了这些用户的即时流量,但并未抹除已经流向外界的代码或机器人。一旦工具被打包并分发,提供商的控制权也就随之结束了。

这对 AI 安全意味着什么

这份报告迫使人们重新思考如何处理“危险”请求。仅靠一份静态的禁用提示词列表已不再奏效。Anthropic 的内部笔记呼吁:

  • 对使用模式进行持续监控,而非一次性的检查。
  • 更严格的访问控制,限制谁可以大规模运行模型。
  • 引入人工分析师,以识别那些看似无害、实则聚集成更大威胁的小型请求集群。

领导者的困境

更严格的防护措施可能会扼杀合法的研究、快速原型设计以及依赖灵活 AI 输出的面向客户的功能。而较宽松的政策则会让滥用行为在不受控制的情况下规模化,从而面临品牌受损、监管审查和现实世界危害的风险。决策者必须在生产力提升与潜在滥用成本之间进行权衡。

展望未来

如果这一趋势持续下去,AI 安全将从实验室层面的关注转向运营层面的关注。公司将需要专门的团队,像对待其他安全事件一样对待模型滥用——监控日志、更新控制措施并实时响应违规行为。Claude 滥用报告警告称,旨在提供帮助的工具,在规模化应用时,可能会变成它们原本想要取代的武器。