Google의 Gemini AI가 저작권이 있는 도서와 기사를 허가 없이 모델 학습에 사용했다는 혐의로 뉴욕 연방법원에 집단 소송을 당했습니다. 주요 출판사와 작가 스콧 투로(Scott Turow)가 포함된 연합이 제기한 이번 소송장에서, 구글은 생성형 AI 시스템에서 "도난당한 자료"의 사용을 숨기기 위해 저작권 정보를 의도적으로 삭제했다고 주장했습니다.

소송 및 주요 주장

뉴욕 남부 연방법원에 제출된 소장에 따르면 Hachette, Cencage, Elsevier, S.C.R.I.B.E. 연합 및 Turow가 원고로 명시되어 있습니다. 이들은 Google이 Google Books를 규정하던 "스니펫(snippet) 전용" 계약의 범위를 넘어, 해당 아카이브의 전체 텍스트 저작물과 Google Play에 업로드된 도서들을 Gemini 학습에 사용했다고 주장합니다. 소장에 따르면 Google은 콘텐츠를 스크래핑했을 뿐만 아니라 저작권 메타데이터를 변경하거나 삭제했으며, 원고들은 이것이 저작권 침해를 은폐하기 위한 의도적인 조치였다고 말합니다.

소송에서 인용된 Google의 내부 메모는 저작권이 있는 도서를 AI 학습에 사용하는 것이 "매우 문제가 될 수 있으며", 회사가 100억 달러에서 1,000억 달러에 달하는 벌금에 처해질 수 있다고 경고합니다. 원고들은 잠재적 책임 규모의 기준으로, 최근 무단 데이터 사용으로 인해 다른 AI 기업이 부과받은 15억 달러의 과징금을 언급했습니다.

사건의 배경

Google과 출판사 간의 관계는 Google Books에서 시작되었습니다. 이는 전체 텍스트는 유료 결제 장벽(paywall) 뒤에 두고, 짧은 발췌문과 서지 정보만을 보여주는 검색 가능한 인덱스 서비스였습니다. 이 모델은 Google이 스니펫만 표시하도록 제한하는 라이선스 계약에 기반했습니다. 수년에 걸쳐 Google은 출판사와 작가들이 판매를 위해 전체 텍스트 e-북을 업로드하는 Google Play 스토어를 통해 보유 자산을 확장했습니다.

원고들은 "범위가 제한된" 인덱싱 서비스에서 대규모 언어 모델(LLM) 학습을 위한 데이터 소스로 전환한 Google의 행보가 기존 계약을 위반한다고 주장합니다. 이들은 Google이 Gemini의 학습 파이프라인에 전체 저작물을 입력하는 데 필요한 광범위한 권한을 확보한 적이 없다고 말합니다.

Google과 AI 산업에 걸린 문제

법원이 라이선스 없이 저작물을 사용하는 것이 저작권법 위반이라고 판단할 경우, 이번 판결은 AI 개발자들이 학습 데이터를 수집하는 방식을 근본적으로 바꿀 수 있습니다.

예상되는 방어 논리와 반론

Google은 논평, 비평 또는 변형을 목적으로 저작물을 제한적으로 사용하는 것을 허용하는 "공정 이용(fair use)" 원칙에 의존할 가능성이 높습니다. 최근 캘리포니아 법원의 판결은 AI 학습을 변형적 활동으로 간주하여 공정 이용 보호를 부여한 바 있습니다. 뉴욕의 원고들은 이러한 선례를 피하기 위해 해당 관할권 밖에서 소송을 제기했습니다.

이에 대해 원고들은 저작권 메타데이터를 삭제한 것이 출처를 숨기려는 의도를 보여주며, 이는 선의의 변형이라는 주장을 무력화한다고 반박합니다. 또한 그들은 Google이 법적 위험을 인지하고 있었다는 증거로 내부 메모를 인용했습니다.

향후 관전 포인트

이번 사건은 양측의 논거를 형성할 수 있는 사전 심리 절차(pre-trial motions)를 거치게 될 것이며, 여기에는 법원이 캘리포니아에서 사용된 공정 이용 분석을 적용할지 아니면 다른 기준을 채택할지가 포함됩니다. 관할권에 대한 판결은 뉴욕 법원이 AI 관련 저작권 분쟁의 주요 무대가 될지를 결정할 수 있습니다.

요약: Google의 Gemini를 상대로 한 뉴욕 소송은 허용 가능한 데이터 사용과 저작권 침해 사이의 경계를 다시 설정하여, AI 개발자들이 모델을 구동하는 원재료를 확보하는 방식을 재고하게 만들고 산업 전체의 경제 구조를 재편할 수 있습니다.