Anthropic 现在在 Claude 的每一条回复中都嵌入了一种隐藏的统计模式——SynthID-Text。公司表示,此举符合《欧盟人工智能法案》(EU AI Act)的透明度准则(Transparency Code),并为开发者提供了一种证明文本出自 AI 模型的方法。该水印在经过简单编辑后依然存在,同时不会影响人类读者的阅读体验。
为什么要添加水印
欧洲监管机构一直向大语言模型(LLM)提供商施压,要求使 AI 生成的内容与人类写作能够区分开来。《欧盟人工智能法案》的透明度准则即将在该地区强制执行,要求开发者必须为模型生成的任何文本提供可靠的检测方法。Anthropic 通过采用 Google DeepMind 去年首次描述的 SynthID-Text 技术来应对这一要求。
这一决定在 Reddit 和 X 上引发了热烈讨论,用户担心水印可能会降低输出质量,或者成为监控的后门。Anthropic 反驳称,该模式对读者是不可见的,不会增加延迟,并且可以在私有部署中关闭。通过公布技术细节,公司希望平息猜测,并为行业树立基准。
SynthID-Text 的工作原理
传统的 AI 检测器通过扫描语言特征来工作——例如重复的短语、奇怪的标点符号或与人类写作的统计偏差。一旦人类重写了段落,这些信号就会消失,导致检测器变得不可靠。相比之下,SynthID-Text 在模型的 token 选择步骤中嵌入了一个隐蔽信号。
当 Claude 在两个同样合理的 token 之间进行选择时——例如“overcast”(阴天)与“grey”(灰色)——系统会将决策向符合预计算二进制模式的那个 token 倾斜。在整个文档的长度范围内,这些微小的倾斜会形成一个比特序列,检测 API 随后可以从中提取出来。该模式的设计刻意保持了低影响性:所选的同义词仍然是完全自然的词汇,因此文本的流畅度保持不变。由于水印存在于 token 流中而非表面文本中,因此它可以在不替换每个 token 的情况下,经受住大多数下游处理。
抗编辑性:哪些内容能保留,哪些不能
一个常见的批评是,用户只需简单编辑 AI 生成的散文即可抹除水印。Anthropic 的内部测试概述了三种编辑场景:
- 轻度编辑 —— 修正拼写错误、更换几个形容词或调整句子顺序。由于大多数 token 保持不变,水印的统计特征在很大程度上得以保留。
- 重度 Claude 辅助编辑 —— 提示 Claude 重写已经包含 AI 生成句子的草稿。如果用户保留了大部分措辞的控制权,水印信号会随着新的人类选择文本比例的增加而减弱。
- 完全重写 —— 用全新的生成内容或手动重写来替换每一个 token。在这种情况下,原始水印会被破坏,但生成的文本将不再符合欧盟对“AI 生成”的定义,因为原始模型输出的痕迹已荡然无存。
结论:水印可以抵御随意的润色,但无法抵御内容的完全重新生成。
代码生成:水印存在的位置
Claude 被广泛用作编程助手,生成的代码从单行代码片段到全栈模块不等。编程语言几乎没有同义词选择的空间;将“for”之类的 token 换成“while”会改变逻辑。因此,Anthropic 预计水印将几乎只出现在模型有权选择词汇的部分——即代码中的注释、docstrings 以及随附的解释性文字中。
由于代码的功能部分保持不变,开发者不应看到正确性或性能的下降。水印的存在仅限于帮助人类理解代码的辅助文本,这在不损害实用性的情况下满足了透明度要求。
行业连锁反应
Anthropic 并非孤军奋战。其他几家 LLM 开发商也签署了相同的行为准则(Code of Practice),要求建立标准化的检测 API。如果欧盟的执行时间表按计划推进,水印可能会成为 LLM 技术栈中的默认层,就像今天的加密技术用于数据传输一样。忽视这一要求的公司将面临罚款、失去欧洲市场准入权或被迫撤出其服务的风险。
争议点
批评人士认为,即使是不可见的隐藏签名,也可能被重新用于监管合规之外的追踪或归属。他们还担心误报问题:如果检测 API 错误地将人类编写的文本标记为 AI 生成,可能会削弱用户对依赖该信号的平台的信任。Anthropic 承认了这些风险,并表示检测算法将开源,从而允许进行独立的审计和校准。
另一个实际的担忧是生成水印带来的计算开销。Anthropic 报告称,额外的处理过程对推理时间的影响不到百分之一,这一说法很快将接受第三方基准测试的检验。
后续关注点
- API 发布 – Anthropic 计划发布一个公共端点,用于从任何 Claude 输出中提取隐藏的比特模式。开发者将能够把这一检测功能集成到内容审核流程中。
- 标准化工作 – 监管机构和行业团体正在起草水印元数据的通用格式,这可能会使跨模型检测变得更加容易。
- 实证研究 – 独立研究人员正开始探测 SynthID-Text 对抗对抗性改写工具的韧性。他们的研究结果将决定平台对该信号的信任程度。
总结
Anthropic 采用 SynthID-Text 为 AI 社区提供了一个具体的工具,在满足即将出台的欧洲透明度规则的同时,保持 Claude 输出质量不受影响。该水印在日常校对中依然存在,但在文本被完全重新生成时会消失;同时,它存在于编程输出的非代码部分,不会干扰功能实现。这种方法能否成为行业标准,取决于检测 API 在现实环境中的表现如何,以及隐私和误报问题能否得到解决。
