《纽约时报》指控 OpenAI 在重大版权诉讼中隐瞒证据
《纽约时报》(The New York Times)与 OpenAI 之间正在进行的法律斗争发生了戏剧性的转折,有指控称这家 AI 巨头故意隐瞒了有关其训练数据集的证据。这一事态升级可能会使诉讼的焦点从版权侵权转向司法证据开示(discovery)过程的完整性。
关于欺骗性数据行为的指控
《纽约时报》和《每日新闻》(The Daily News)声称,OpenAI 在其搜索训练语料库和客户聊天记录的技术能力方面一直不诚实。在长达两年的诉讼过程中,OpenAI 一直坚称,搜索其海量数据集在技术上负担沉重,且会损害用户隐私。
然而,OpenAI 数据隐私工程师 Vinnie Monaco 最近的一份证词挑战了这一说法。据称,Monaco 透露 OpenAI 已经对其训练语料库进行了内部搜索,专门用于识别受版权保护的新闻作品。此外,证词还表明,OpenAI 已经收集了一个包含约 7800 万条去标识化 ChatGPT 对话的数据库,用于内部评估潜在版权侵权的程度。
“Project Giraffe”与“Bloom”过滤器
或许最重要的技术披露涉及 OpenAI 实施的一套工具——“Project Giraffe”。原告称,在诉讼提起后不久,OpenAI 便在该项目中使用“Bloom”过滤器来检测并记录“内容复读”(regurgitation)的情况,即模型在输出中逐字逐句地复制受版权保护的内容。
Project Giraffe 的存在反驳了 OpenAI 此前的立场,即在日志中识别特定内容复制实例是一项难以完成的任务。原告辩称,这些工具证明 OpenAI 不仅有能力监控版权侵权,而且还在积极构建用于追踪侵权的架构。
关于数据完整性与证据开示的争议
冲突的焦点还在于提供给法院的数据质量。虽然原告最初要求提供 1.2 亿条聊天记录样本,但 OpenAI 将这一数字协商减至 2000 万条。据报道,当样本最终在 12 月提交时,法院因过度涂改(redactions)而认为其“无法使用”。
《纽约时报》甚至进一步指控,OpenAI 违反了法院下达的证据保全令(preservation order),删除了数十亿条 ChatGPT 输出内容,并在提供的样本中替换了数百万条日志。对此,OpenAI 发言人 Drew Pusateri 否认了所有指控,并指责《纽约时报》在其法律案件走弱之际试图侵犯用户隐私。
为什么这对 AI 行业至关重要
此案是生成式 AI 未来发展以及“合理使用”(fair use)法律界限的风向标。如果法院认定 OpenAI 隐瞒证据或操纵证据开示过程,可能会为 AI 公司如何披露其训练方法和数据来源(data lineage)设定先例。对于开发者和 AI 创业者而言,案件结果将明确在处理海量数据摄取与知识产权交集时所需的透明度水平。
核心要点
- 内部监控工具: 指控表明 OpenAI 使用了“Project Giraffe”和“Bloom”过滤器来积极追踪受版权保护内容的复读情况。
- 矛盾的证词: 证词证据表明 OpenAI 具备搜索其训练数据的技术能力,这与其此前关于技术负担沉重的说法相矛盾。
- 证据开示的完整性面临挑战: 诉讼现在的关键在于 OpenAI 是否通过删除输出内容以及提供“无法使用”的涂改数据样本,违反了证据保全令。
