NYT、大規模な著作権裁判においてOpenAIが証拠を隠蔽したと非難
The New York TimesとOpenAIの間で続いている法廷闘争は、AI大手がトレーニングデータセットに関する証拠を意図的に隠蔽したという疑惑により、劇的な展開を迎えている。この事態の悪化は、訴訟の焦点が著作権侵害から、司法における証拠開示(ディスカバリー)プロセスの整合性へと移る恐れを孕んでいる。
不当なデータ慣行に関する疑惑
The New York TimesとThe Daily Newsは、OpenAIがトレーニングコーパスと顧客のチャットログの両方を検索する技術的能力について、虚偽の主張を行ってきたと主張している。2年間にわたる訴訟を通じて、OpenAIは、膨大なデータセットを検索することは技術的に負担が大きく、ユーザーのプライバシーを侵害することになると主張し続けてきた。
しかし、OpenAIのデータプライバシーエンジニアであるVinnie Monaco氏による最近の証言録取(デポジション)が、この主張に疑問を投げかけている。Monaco氏は、OpenAIが著作権で保護されたジャーナリズム作品を特定するために、トレーニングコーパスの内部検索をすでに行っていたことを明らかにしたとされる。さらに、この証言録取は、OpenAIが潜在的な著作権侵害の範囲を内部的に評価するために、匿名化された約7,800万件のChatGPTの会話データベースを蓄積していたことを示唆している。
「Project Giraffe」と「Bloom」フィルター
おそらく最も重要な技術的発見は、OpenAIが導入したツールセットである「Project Giraffe」に関するものである。原告側によれば、訴訟が提起された直後、OpenAIはこのプロジェクトの一環として「Bloom」フィルターを利用し、モデルが出力において著作権で保護されたコンテンツを逐語的に再現する「リガージェテーション(吐き出し)」の事例を検出し、記録していたという。
Project Giraffeの存在は、ログ内におけるコンテンツ再現の特定の事例を特定することは困難な作業であるとしてきたOpenAIのこれまでの立場と矛盾する。原告側は、これらのツールは、OpenAIが著作権侵害を監視する能力があっただけでなく、それを追跡するためのインフラを積極的に構築していたことを証明していると主張している。
データの整合性と証拠開示をめぐる紛争
紛争は、裁判所に提出されたデータの品質にも及んでいる。原告は当初1億2,000万件のチャットログのサンプルを要求していたが、OpenAIとの交渉により2,000万件に削減された。12月にようやくサンプルが提出された際、過度な黒塗り(編集)が行われていたため、裁判所はそれを「使用不能」と判断したと報じられている。
NYTはさらに踏み込み、OpenAIが裁判所の証拠保存命令に違反して数十億件のChatGPTの出力を削除し、提供されたサンプル内の数百万件のログを差し替えたと主張している。これに対し、OpenAIの広報担当者であるDrew Pusateri氏はすべての疑惑を否定し、訴訟が弱まるにつれてTimes紙がユーザーのプライバシーを侵害しようとしていると非難している。
なぜこれがAI業界にとって重要なのか
この訴訟は、生成AI開発の未来と「フェアユース(公正利用)」の法的境界線を示す試金石となる。もし裁判所が、OpenAIが証拠を隠蔽したり証拠開示を操作したりしたと判断すれば、AI企業がトレーニング手法やデータの系統(データ・リネージ)をどのように開示すべきかについての先例となる可能性がある。開発者やAIの創業者にとって、この結果は、膨大なデータの取り込みと知的財産権が交差する領域をナビゲートする際に求められる透明性のレベルを明確にするものとなるだろう。
主なポイント
- 内部監視ツール: OpenAIが「Project Giraffe」と「Bloom」フィルターを使用して、著作権で保護されたコンテンツの「リガージェテーション(吐き出し)」を積極的に追跡していたという疑惑がある。
- 矛盾する証言: 証言録取の証拠は、OpenAIがトレーニングデータを検索する技術的能力を有していたことを示唆しており、技術的な負担を理由としてきたこれまでの主張と矛盾している。
- 証拠開示の整合性が焦点: 訴訟は現在、OpenAIが出力を削除して証拠保存命令に違反したか、および「使用不能」な黒塗り済みデータサンプルを提供したかどうかにかかっている。
