Anthropic 对其 Fable 5 模型进行了重大更新,大幅减少了其安全层拦截的良性生物学查询数量。这一战略性调整旨在恢复合法科学研究的效用,同时保持对高风险生物威胁的严格防护。
降低科研阻力
在科学界批评的推动下,Anthropic 已成功将其 Fable 5 生物安全过滤器的误报率降低了约 85%。此前,该模型的安全分类器过于激进,频繁拦截合法的科学查询,并将用户重定向至能力较弱的 Opus 5 模型。
此次更新允许研究人员和医疗专业人员利用 Fable 5 的完整推理能力来处理广泛的良性任务。用户现在可以执行复杂的任务,例如解读实验室结果、分析临床症状以及回答复杂的医学问题,而不会触及此前阻碍生产力的“安全墙”。
维持对双重用途风险的护栏
尽管放宽了通用的生物学限制,Anthropic 仍对“双重用途”研究——即可能被转用于有害目的的信息——保持强硬立场。该公司并未取消对高度敏感话题的限制,包括病毒学、毒理学和高级分子设计。
Anthropic 的推理基于生物威胁的独特性质。与可以通过补丁和系统关闭来缓解的网络攻击不同,一旦释放生物制剂,几乎不可能将其“关闭”。该公司引用了驱动这一谨慎态度的几个高风险担忧,包括:
- 美国情报机构关于生物风险的分析。
- 证明 AI 可被用于设计全合成病毒的研究。
- 有记录显示的、用户试图从现有 LLM 中索取生物武器指令的行为。
在安全与专业访问之间取得平衡
AI 实验室面临的挑战在于如何处理开放科学进步与防止灾难性滥用之间的紧张关系。Anthropic 正试图通过开发专业访问计划来解决这一问题。这些计划旨在允许经过验证的研究人员在受控且经过审计的环境中,访问受限功能——例如涉及病毒学或分子建模的功能。
通过区分良性医学查询与危险的双重用途研究,Anthropic 正试图为前沿模型如何处理“生物学前沿”树立先例,确保现代医学工具不会在无意中成为生物恐怖主义的工具。
核心要点
- 误报率降低 85%: Anthropic 显著降低了合法生物学查询的门槛,使用户不再被迫使用降级的 Opus 5。
- 高风险领域保持严格护栏: 对病毒学、毒理学和分子设计仍保持严格限制,以防止生物武器的制造。
- 为研究人员提供受控访问: Anthropic 正在建立特定的访问计划,为经过审核的科学家提供合法研究所需的受限能力。
Anthropic 已将其 Fable 5 模型中对良性生物学查询的误报拦截减少了约 85%,恢复了研究人员使用该模型完整推理能力的机会。此次变更保留了对双重用途生物话题的严格防护,禁止模型提供可能实现生物武器制造的指令。
为什么这次更新很重要
Fable 5 的安全层最初的设定倾向于保守,将大量合法的科学问题标记为高风险。要求进行常规实验室结果解读或临床症状分析的用户,会被例行重定向至能力较弱的 Opus 5 模型。这种过度拦截引发了科学界的批评,认为这种阻力妨碍了真正的研究并减慢了医疗决策。通过将误报率削减约五分之四,Anthropic 旨在将模型的先进推理能力重新交还给需要将其用于日常任务的医生、生物学家和其他专业人士。
过滤器是如何更改的
这一改进源于一个重新调整的分类器,它能够区分普通的生物医学查询与涉及“双用途”研究的查询——即可能被重新利用于有害目的的信息。新的分类器仍然会拦截涉及病毒学、毒理学和高级分子设计的请求,但会放行有关标准诊断、症状分诊和数据解读的问题。
Anthropic 的工程师指出,生物威胁与网络威胁不同:一旦病原体被释放,就无法通过“打补丁”或“关机”来解决。这一现实促使公司做出决定:在对高风险领域保持严格界限的同时,放宽对常规医疗咨询的限制。
哪些内容仍被禁止
该模型将继续拒绝可能助长有害制剂制造的请求。具体而言,任何寻求以下内容的提示词都将被拒绝:
- 可能有助于病毒合成的详细病毒学方案,
- 可武器化化学物质的毒理学路径,或
- 分步分子工程指令。
Anthropic 为其谨慎态度引用了三个来源:强调生物风险的美国情报机构分析、表明 AI 可以设计全合成病毒的研究,以及记录在案的用户试图从现有语言模型中获取生物武器指令的行为。
针对经过审核的科学家的访问计划
为了在开放研究与安全性之间取得平衡,Anthropic 正在推出一项专门的访问计划。经过验证的研究人员可以申请进入一个受控环境,在审计下解锁受限功能。该计划旨在让合法的科学家能够探索高风险课题——例如新型疫苗平台或病原体建模——而不会让广大公众接触到危险的指导。
总结
通过在保持严格的双用途禁令的同时减少 85% 的误报拦截,Anthropic 旨在为研究人员提供其最强大模型的能力,同时又不为生物武器设计打开大门。这种经过校准的安全策略的成功,可能会为前沿 AI 模型如何处理其他高风险科学领域树立模板。
