滥用行为是如何被发现的
Anthropic 的内部监控标记了一系列“双用途”查询——这些请求虽然可能支持合法的研究,但也可能被用于有害的应用。一名研究人员要求 Claude 设计能够使基孔肯雅病毒(Chikungunya virus)更具传染性的突变。该请求的措辞以及在活体动物身上进行的重复测试,表明其属于军事研究背景,而非公共卫生工作。为了掩盖真实意图,用户使用了具有误导性的措辞,这促使 Anthropic 对其更新、功能更强大的模型加强了生物安全防护措施。
平行的调查还发现了试图生成火器、导弹制导系统、武装无人机和炸弹组件的设计图及源代码的行为。其中六次查询可追溯到中国、俄罗斯和也门的 IP 地址;也门的活动似乎与伊朗支持的胡塞武装有关。在另一条线索中,Anthropic 识别出了 AI 驱动的虚假信息运动:中国和伊朗的政府行为体利用 Claude 来监控海外侨民社区,而俄罗斯官方媒体则利用该模型制作“独立”文章,散布关于摩尔多瓦选举的虚假言论。
报告为何至关重要
这些披露正值 AI 模型从聊天机器人演变为具备科学推理能力的工具之际。对于各国政府而言,风险体现在两个方面。首先,获取先进 AI 的门槛降低,使得国家或非国家行为体发起非法武器计划变得更加容易。其次,同样的模型也成为了信息战的载体,能够进行难以追踪的复杂宣传。该报告向决策者施加了压力,要求将 AI 视为受出口管制、生物安全法规和网络防御策略约束的双用途技术。
Anthropic 的回应与内部紧张局势
作为回应,Anthropic 在其最新的模型系列中推出了更严格的防护措施,明确拦截了要求进行病原体操纵或武器设计的查询。
该报告是在内部摩擦中浮出水面的。研究员 Jacob Coxon 于今年早些时候辞职,他警告称,行业向更强大系统迈进的速度超过了安全网建设的速度。他的离职凸显了一个更广泛的辩论:在缺乏明确政府框架的情况下,私营 AI 公司正充当着事实上的“数字警察”,决定什么才算作安全威胁。批评者认为,自我监管无法跟上对手的创造力,而支持者则指出 Anthropic 迅速的政策调整证明了行业可以快速适应。
研究结果对印度的启示
- 生物安全警惕 – 印度不断增长的生物技术领域将越来越依赖 AI 进行药物研发和病原体分析。将 AI 驱动的监控嵌入现有的生物安全协议中,可以识别出利用国内工具进行双用途研究的企图。
- 捍卫民主话语 – Claude 被用于监控侨民团体和散布与选举相关的虚假信息,这表明需要更强大的网络防御措施和公众意识运动,以识别 AI 生成的虚假信息。
- 构建主权 AI 能力 – 在高风险科学工作中依赖基于美国的模型凸显了战略差距。开发嵌入印度安全标准和伦理准则的本土模型,可以减少受外国影响的风险,并控制敏感 AI 能力的流动。
反方观点:支持自我监管的理由
Anthropic 快速推出新过滤器表明,私营公司可以比许多立法机构行动得更快。该公司认为,其“负责任使用”政策结合持续的红队测试,在政府讨论正式监管期间提供了一种务实的权宜之计。支持者指出,过度规范的法律可能会扼杀创新,特别是在 AI 能加速医学突破的领域。挑战在于如何取得平衡,使行业的防护措施既透明、可审计,又不阻碍 AI 所承诺的有益应用。
后续关注点
- 监管动态 – 预计出口管制机构和生物安全监管机构将加强审查,这可能会导致出台新的指南,将先进的生成式模型视为受控技术。
- 行业协作 – Anthropic 可能会加入或扩大现有的 AI 安全联盟以共享威胁情报,此举可能会使整个行业对双重用途尝试的报告实现标准化。
- 国家响应 – 报告中提到的国家可能会否认参与,并可能加速自身的 AI 开发计划,从而形成一个反馈循环,进一步模糊防御性与进攻性 AI 使用之间的界限。
Anthropic 的报告表明,帮助科学家进行蛋白质建模的同一种生成能力也可能被武器化,而 AI 安全现在已完全进入了地缘政治领域。未来几个月将考验自我监管、政府政策或混合模式是否能够防止该技术成为冲突的工具。
