创意社区不再只是被动地看着自己的毕生心血被吸收到庞大的训练数据集中。从享誉盛名的作家到数字插画师,一波日益增长的法律行动正在挑战 AI 巨头用来为未经授权抓取知识产权辩护的“合理使用”(fair use)原则。

发现未经授权的训练集

随着《大西洋月刊》(The Atlantic)发布了一份详细列出用于训练大语言模型作品的可搜索数据集,创作者与 AI 开发商之间的紧张关系达到了沸点。对于像 Kirk Wallace Johnson 这样的作家来说,这一发现既是私人的也是深远的。Johnson 以《羽毛窃贼》(The Feather Thief)和《渔夫与龙》(The Fishermen and the Dragon)等深度研究的非虚构作品闻名,他发现自己多年艰辛的研究和写作成果在未经许可或补偿的情况下,被盗用并喂给了聊天机器人。

这种现象并非孤立事件,而是一种系统性的做法。创意专业人士发现,他们的专有作品——通常是多年劳动的结晶——正被用来构建“富可敌国”的企业。这一认识已使情绪从单纯的担忧转向积极的诉讼,艺术家们正寻求重新夺回对其知识产权的控制权。

战略诉讼:瞄准科技巨头

法律攻势是多方面的,针对的是生成式 AI 模型构建的核心机制。艺术家们不仅依赖版权侵权指控,还在探索违反服务条款等途径,以追究公司的责任。

高调的法律斗争已经在进行中。许多创作者已与 Susman Godfrey 等专业法律团队联手,该公司目前正代表多位作者对 Anthropic 发起重大诉讼。该运动的其他先驱包括插画家和漫画家 Sarah Andersen,她是首批直接向 AI 巨头发起挑战的人之一。这些诉讼旨在拆解行业对无偿数据抓取的依赖,并为训练集的策划制定新标准。

“合理使用”的战场

这些法庭上的核心矛盾在于“合理使用”的法律定义。AI 公司辩称,利用现有数据训练模型具有“转化性”(transformative),属于法律保护范围。然而,创作者认为,当 AI 能够复制艺术家的特定风格或作家的独特语调时,它就不再具有转化性,而是变成了直接的市场替代品,从而贬低了原作的价值。

随着这些案件的进展,它们将定义 AI 领域的未来。结果将决定当前的“AI 垃圾”(AI slop)轨迹——即低质量、衍生内容的批量生产——在法律上是否具有可持续性,或者是否必须出现一个获得许可、符合伦理的数据获取新时代,以保护处于信息经济核心的人类创作者。

核心要点

  • 系统性数据抓取: 已发现主要 AI 模型在未经创作者同意的情况下,使用了包含深度研究书籍和专有艺术作品的盗版数据集。
  • 多样化的法律策略: 诉讼正通过版权侵权、违反服务条款以及对“合理使用”原则的挑战来针对 AI 公司。
  • 知识产权的关键时刻: 针对 Anthropic 等公司的持续诉讼结果,将为生成式 AI 时代知识产权的价值评估设定法律先例。

争议是如何爆发的

导火索出现在一家主流杂志发布了一份可搜索的清单,列出了用于训练大语言模型的书籍、文章和艺术作品。对于非虚构作品需要多年研究和旅行的作家 Kirk Wallace Johnson 来说,这一揭露是极具个人冲击力的。他发现,他花费十年时间完善的文字,竟然成为了驱动聊天机器人的数据的一部分,而这些机器人可以根据需求复制他的风格,却不支付任何版税或给予任何认可。

Johnson 的经历并非孤例。文学、插画、音乐和电影领域的创作者都在报告,他们的版权作品正被大规模收割。业内人士将这种做法描述为对“盗版数据集”的系统性提取,这已使担忧转化为协调一致的法律行动。艺术家们现在认为,他们创造的价值正被抽走,流向那些从他们的劳动中获利的“富可敌国”的科技巨头,而创作者却一无所获。

塑造这场斗争的诉讼案

这场法律攻势直指生成式 AI 模型构建的核心。原告不仅提出了版权侵权指控,还指控平台违反了其自身的服务条款。插画家兼漫画家 Sarah Andersen 的作品已成为互联网文化的重要组成部分,她是首批对 AI 公司提起直接诉讼的视觉艺术家之一。她的诉状主张,模型模仿其独特线条风格和幽默感的能力侵蚀了其原创漫画的市场,实际上将其品牌变成了一个任人使用的免费资源。

这些案件由专门从事知识产权纠纷、且有挑战科技巨头经验的律师负责处理。他们的策略是强制要求披露所使用的确切数据集,迫使公司停止使用有争议的材料,并寻求反映被盗内容商业价值的损害赔偿。

备受质疑的“合理使用”辩护

AI 开发商坚称,利用公开数据训练模型属于法律保护的“转换性使用”。他们认为,模型并不会原封不动地复制任何单一作品;相反,它学习的是能够生成新文本或图像的模式。从这个角度来看,这一过程类似于研究人员通过阅读大量书籍来获取见解,而非单纯的复制。

创作者们反驳称,当输出结果几乎可以成为作者语调或艺术家风格的复制品时,“转换性”就是一个牵强的借口。当聊天机器人能以某位小说家标志性的节奏和措辞来回答问题,或者当图像生成器能产生与在世插画家作品集无法分辨的图片时,其结果实际上充当了市场替代品。原告认为,这种替代损害了他们销售书籍、承接委托创作和达成授权交易的能力,而“合理使用”的辩护在商业影响面前也显得站不住脚。

关键影响

  • AI 公司的经济压力 —— 如果法院裁定大规模抓取行为违反了版权法,公司可能会面临重大的财务后果,这可能会促使它们改变数据采集流程。

  • 法院文件与证据开示 —— 下一波文件将揭示究竟使用了哪些书名和图像,从而更清晰地展现数据采集的规模。