NYT, 주요 저작권 소송에서 OpenAI가 증거를 은닉했다고 비난
The New York Times와 OpenAI 간의 지속적인 법적 공방이 급격한 전환점을 맞이했습니다. AI 거대 기업인 OpenAI가 학습 데이터셋과 관련된 증거를 의도적으로 은폐했다는 의혹이 제기되었기 때문입니다. 이러한 갈등의 심화는 소송의 초점을 저작권 침해에서 사법적 증거 개시(discovery) 과정의 무결성 문제로 옮겨놓을 위협이 되고 있습니다.
기만적인 데이터 관행에 대한 의혹
The New York Times와 The Daily News는 OpenAI가 학습 코퍼스(corpus)와 고객 채팅 로그를 모두 검색할 수 있는 기술적 능력에 대해 부정직하게 대응해 왔다고 주장합니다. 2년간의 소송 과정 동안 OpenAI는 방대한 데이터셋을 검색하는 것이 기술적으로 부담스러우며 사용자의 개인정보를 침해할 수 있다는 입장을 유지해 왔습니다.
하지만 최근 OpenAI의 데이터 개인정보 보호 엔지니어인 Vinnie Monaco의 증언(deposition)이 이러한 주장에 반기를 들었습니다. Monaco는 OpenAI가 저작권이 있는 저널리즘 저작물을 식별하기 위해 이미 학습 코퍼스에 대한 내부 검색을 수행했다고 폭로한 것으로 알려졌습니다. 또한, 해당 증언은 OpenAI가 잠재적인 저작권 침해 범위를 내부적으로 평가하기 위해 약 7,800만 건의 비식별 처리된 ChatGPT 대화 데이터베이스를 구축했다는 점을 시사합니다.
Project Giraffe와 "Bloom" 필터
아마도 가장 중요한 기술적 폭로는 OpenAI가 구현한 도구 모음인 "Project Giraffe"와 관련이 있을 것입니다. 원고 측에 따르면, 소송이 제기된 직후 OpenAI는 이 프로젝트의 일환으로 "Bloom" 필터를 사용하여 모델이 출력물에 저작권이 있는 콘텐츠를 그대로 재현하는 이른바 "역류(regurgitation)" 사례를 탐지하고 기록했습니다.
Project Giraffe의 존재는 로그 내에서 특정 콘텐츠 재현 사례를 식별하는 것이 불가능한 작업이라는 OpenAI의 이전 입장과 모순됩니다. 원고 측은 이러한 도구들이 OpenAI가 저작권 침해를 모니터링할 수 있었을 뿐만 아니라, 이를 추적하기 위한 인프라를 적극적으로 구축하고 있었음을 증명한다고 주장합니다.
데이터 무결성 및 증거 개시를 둘러싼 분쟁
이번 갈등은 법원에 제출된 데이터의 품질 문제로도 번졌습니다. 원고 측은 당초 1억 2,000만 건의 채팅 로그 샘플을 요청했으나, OpenAI와의 협상을 통해 2,000만 건으로 줄어들었습니다. 지난 12월 샘플이 최종 제출되었을 때, 법원은 과도한 편집(redaction)으로 인해 해당 데이터를 "사용할 수 없는" 상태라고 판단한 것으로 알려졌습니다.
NYT는 한 걸음 더 나아가, OpenAI가 법원의 증거 보존 명령을 위반하여 수십억 건의 ChatGPT 출력물을 삭제했으며, 제공된 샘플 내 수백만 건의 로그를 교체했다고 주장하고 있습니다. 이에 대해 OpenAI의 대변인 Drew Pusateri는 모든 의혹을 부인하며, Times 측이 소송에서 불리해지자 사용자의 개인정보를 침해하려 시도하고 있다고 반박했습니다.
이것이 AI 산업에 중요한 이유
이번 사건은 생성형 AI 개발의 미래와 "공정 이용(fair use)"의 법적 경계를 가늠할 수 있는 지표(bellwether)입니다. 만약 법원이 OpenAI가 증거를 은닉하거나 증거 개시 과정을 조작했다고 판단한다면, 이는 AI 기업들이 학습 방법론과 데이터 계보(data lineage)를 공개해야 하는 방식에 대한 선례가 될 수 있습니다. 개발자와 AI 창업자들에게 이번 결과는 방대한 데이터 수집과 지적 재산권이 교차하는 지점에서 요구되는 투명성의 수준을 명확히 해줄 것입니다.
핵심 요약
- 내부 모니터링 도구: OpenAI가 "Project Giraffe"와 "Bloom" 필터를 사용하여 저작권 콘텐츠의 재현(regurgitation)을 적극적으로 추적했다는 의혹이 제기되었습니다.
- 모순된 증언: 증언(deposition) 증거에 따르면 OpenAI는 학습 데이터를 검색할 수 있는 기술적 능력을 갖추고 있었으며, 이는 기술적 부담을 이유로 내세웠던 이전 주장과 모순됩니다.
- 증거 개시의 무결성 위기: 이번 소송은 OpenAI가 출력물을 삭제하여 증거 보존 명령을 위반했는지, 그리고 "사용할 수 없는" 편집된 데이터 샘플을 제공했는지 여부에 달려 있습니다.
