美国司法部在媒体巨头与 AI 开发商之间持续不断的著作权战争中,发出了重大的法律干预。通过辩称在受著作权保护的数据上训练大语言模型 (LLMs) 构成“合理使用”,司法部为 OpenAI 和 Microsoft 等公司提供了巨大的法律护盾。

司法部的论点:训练 vs. 输出

涉及《纽约时报》的合并诉讼的核心在于 AI 如何学习与它产出什么之间的根本区别。《纽约时报》指控其数百万篇文章在未经许可的情况下被用于训练 GPT-4 等模型,造成了数十亿美元的损失,并创造了与该报直接竞争的产品。

然而,司法部最近的备案辩称,著作权侵权发生在输出阶段,而非摄取阶段。该部门认为,虽然在训练阶段复制了整个作品,但这些副本从未公开。此外,司法部断言,像 GPT-4 这样的模型的输出“往往(如果不是总是的话)与原始素材缺乏实质性相似”。通过将训练过程与生成内容分离,司法部正试图将机器学习行为与“市场替代”这一法律概念解耦。

“海明威类比”与人类创造力

为了让机器学习的概念更易理解,司法部引用了一个涉及作家 Joan Didion 的文学类比。备案指出,Didion 在青少年时期会通过抄写 Ernest Hemingway 的故事来分析其句子结构并学习技巧。司法部辩称,如果法律将机器训练视为侵权,那么像 Didion 这样的作家理论上每次发表新作品时都可能面临责任,因为她的学习过程与其随后的写作密不可分。

该部门进一步辩称,对 AI 训练施加严格责任,反而会扼杀著作权法旨在保护的创造力。随着人类越来越多地使用 LLMs 来起草和编辑原创作品,司法部暗示,如果不建立大规模的许可机制,将训练视为非法将使 AI 驱动的创新陷入瘫痪。

向美国版权局发起挑战

司法部的立场直接反驳了美国版权局最近的调查结果。前注册官 Shira Perlmutter 此前曾反对一揽子“合理使用”辩护,指出 AI 的运作规模和速度远超人类能力,并且经常创造出与原始内容创作者直接竞争的商业产品。

司法部对这一评估发起了攻势,称 Perlmutter 的报告不具有约束性的法律效力,且未能考虑到关于逐案分析的既定判例法。该部门警告称,施加广泛的责任将实际上强制执行一种许可制度,从而使先进 AI 模型的开发在法律和财务上都变得不可能。

关键要点

  • 训练与输出的分离: 司法部辩称,如果生成的模型输出与原始作品不显示“实质性相似”,那么为了训练而复制文本并不构成侵权。
  • 保护创新: 该部门警告称,要求所有训练数据都必须获得许可将扼杀创造力,并阻碍辅助人类进行内容创作的 LLMs 的发展。
  • 法律风向标: 此次干预在司法部与美国版权局之间制造了高风险的冲突,为关于生成式 AI 未来的决定性法院裁决奠定了基础。

文章: 美国司法部在《纽约时报》的著作权诉讼中提交了一份法庭之友陈述书,辩称复制受保护的文本来训练大语言模型 (LLMs) 符合合理使用。该备案为 OpenAI 和 Microsoft 等公司提供了一个法律护盾,可能使它们免于该报估计高达数十亿美元的赔偿金池。

为什么此案现在至关重要

该诉讼合并了几项指控,即 AI 开发商在未经许可的情况下将数百万篇报纸文章输入其模型,然后发布了与《纽约时报》自身报道直接竞争的产品。如果法院拒绝司法部的合理使用辩护,AI 公司可能会面临巨额的许可费用,或者被迫停止下一代对话代理的开发。

司法部的核心论点

该法律文书将 AI 工作流分为两个截然不同的阶段。首先,模型摄取大规模文本语料库;其次,它根据用户提示生成响应。司法部表示,只有当受版权保护的作品以公众可以访问的方式被复制时,才会产生侵权行为。由于训练副本从未离开开发者的服务器,因此摄取行为并未达到该门槛。

美国司法部还依赖于“实质性相似”测试,这是一项长期存在的版权标准。它主张,像 GPT-4 这样的模型所输出的文本“往往(如果不是始终如此的话)”与任何单一来源都有足够的差异,以至于原告无法证明所需的相似性。简而言之,该文书认为法律关注的重点应该是最终输出,而不是内部学习过程。

用文学类比来阐明这一点

为了使技术论点更易于理解,该文件引用了一个关于一名青少年作家的故事,她通过抄袭海明威的故事来研究其风格。司法部表示,如果法律将这种学习行为视为侵权,那么这位作家每次发表新作品时都可能被起诉,即使她的作品是原创的。司法部警告说,将同样的逻辑延伸到 AI 将会“瘫痪版权法旨在保护的创造力”。

AI 开发商与内容创作者面临的利害关系

  • 创新风险: 要求为训练中使用的每一段文本获取许可,可能会导致成本过高,以至于构建最先进的模型在财务上变得不可行。
  • 创作工作流: 人类作家越来越依赖 LLM 进行起草、编辑和头脑风暴。如果训练过程被视为非法,这些工具可能会消失,从而重塑各行业的内容生产方式。
  • 市场影响: 报业认为,能够回答问题或生成类新闻文本的 AI 模型会削弱原创报道的价值,可能导致广告收入和订阅量的流失。

美国版权局的反驳观点

美国版权局最近发布的一份报告(由前版权局局长 Shira Perlmutter 主导编写)反对一揽子式的“公平使用”辩护。版权局强调了将 AI 与人类学习区分开来的三个因素:复制材料的巨大数量、处理的速度,以及由此产生的模型可以被包装并作为商业产品销售,从而与原始创作者直接竞争。

司法部反驳了这些观点,指出该报告不具有约束性的法律效力,且现有的判例法已经要求对公平使用进行逐项事实分析。它警告说,施加“广泛的责任”实际上会迫使该行业进入一种许可制度,而这种制度“将使开发先进的 AI 模型在法律和财务上变得不可能”。

接下来的走向

处理《纽约时报》案的地方法院必须权衡司法部的公平使用立场与版权局的调查结果。如果法院做出有利于司法部的裁决,将创下一个先例,即只要模型的输出不构成实质性相似,就可以在未经明确许可的情况下采集训练数据。如果裁决支持报社,可能会引发一波许可谈判,从而可能重塑 AI 研究的经济模式。

总结

司法部的文件将“AI 训练是否属于公平使用”这一问题变成了一场高风险的法庭斗争。结果将决定开发商是能够继续基于现有文本构建强大的语言模型,还是必须为他们摄取的每一份材料寻求昂贵的许可。这一决定将波及科技领域、媒体行业以及更广泛的创意经济。