창작 커뮤니티는 자신들의 평생 업적이 거대한 학습 데이터셋에 무단으로 흡수되는 것을 더 이상 수동적으로 지켜보고만 있지 않습니다. 저명한 작가부터 디지털 일러스트레이터에 이르기까지, 점점 더 많은 이들이 AI 거대 기업들이 지식재산권의 무단 스크래핑을 정당화하기 위해 사용하는 '공정 이용(fair use)' 방어 논리에 법적 대응을 이어가고 있습니다.
무단 학습 데이터셋의 발견
창작자와 AI 개발자 사이의 긴장은 대규모 언어 모델 학습에 사용된 저작물을 상세히 기록한 검색 가능한 데이터셋을 공개한 The Atlantic의 보도 이후 임계점에 도달했습니다. 커크 월리스 존슨(Kirk Wallace Johnson)과 같은 작가들에게 이 발견은 개인적이고도 심대한 충격이었습니다. The Feather Thief와 The Fishermen and the Dragon과 같은 심층 조사 논픽션 저서로 알려진 존슨은, 수년간 공들인 조사와 집필의 결과물이 동의나 보상 없이 해킹되어 챗봇의 학습 데이터로 사용되었다는 사실을 알게 되었습니다.
이러한 현상은 단발적인 사건이 아니라 체계적인 관행입니다. 창작 전문가들은 수년간의 노동이 결실을 맺은 자신들의 독점적 저작물이 '은하계 규모의 부'를 축적하는 기업들을 구축하는 데 사용되고 있다는 사실을 깨닫고 있습니다. 이러한 인식은 단순한 우려를 넘어 적극적인 소송으로 이어지고 있으며, 예술가들은 자신의 지식재산권에 대한 통제권을 되찾기 위해 노력하고 있습니다.
전략적 소송: 테크 거물들을 겨냥하다
법적 공세는 생성형 AI 모델이 구축되는 핵심 메커니즘을 겨냥하며 다각도로 진행되고 있습니다. 예술가들은 단순히 저작권 침해 주장만을 내세우는 것이 아니라, 기업에 책임을 묻기 위해 서비스 약관 위반과 같은 경로도 모색하고 있습니다.
이미 주목할 만한 법적 공방이 진행 중입니다. 많은 창작자가 전문 법무팀과 힘을 합치고 있으며, 현재 서스먼 고드프리(Susman Godfrey)는 여러 작가를 대리하여 앤스로픽(Anthropic)을 상대로 중대한 소송을 이끌고 있습니다. 이 움직임의 또 다른 선구자로는 AI 거물들에게 직접적으로 도전한 최초의 인물 중 한 명인 일러스트레이터이자 만화가인 사라 앤더슨(Sarah Andersen)이 있습니다. 이러한 소송은 보상 없는 데이터 스크래핑에 의존하는 업계의 관행을 해체하고, 학습 데이터셋을 큐레이션하는 방식에 대한 새로운 표준을 강제하는 것을 목표로 합니다.
'공정 이용' 격전지
법정 내 핵심 쟁점은 '공정 이용(fair use)'의 법적 정의에 있습니다. AI 기업들은 기존 데이터를 사용하여 모델을 학습시키는 것이 '변형적(transformative)'이며 법적 보호 범위에 해당한다고 주장합니다. 그러나 창작자들은 AI가 특정 예술가의 화풍이나 작가의 독특한 문체를 그대로 재현할 수 있다면, 그것은 더 이상 변형적인 것이 아니라 원작의 가치를 떨어뜨리는 직접적인 시장 대체재가 된다고 반박합니다.
이 사건들의 진행 과정은 AI 산업의 미래를 결정지을 것입니다. 판결 결과에 따라 저질의 파생 콘텐츠를 대량 생산하는 현재의 'AI 슬롭(AI slop)' 흐름이 법적으로 지속 가능한지, 아니면 정보 경제의 핵심인 인간 창작자를 보호하기 위해 라이선스를 기반으로 한 윤리적인 데이터 수집의 새 시대가 열려야 하는지가 결정될 것입니다.
핵심 요약
- 체계적인 데이터 스크래핑: 주요 AI 모델들이 창작자의 동의 없이 심층 조사된 도서와 독점 저작물이 포함된 해킹된 데이터셋을 사용해 온 것으로 밝혀졌습니다.
- 다각화된 법적 전략: 소송은 저작권 침해, 서비스 약관 위반, '공정 이용' 원칙에 대한 이의 제기 등을 통해 AI 기업들을 겨냥하고 있습니다.
- 지식재산권(IP)의 중대한 전환점: 앤스로픽과 같은 기업을 상대로 진행 중인 소송의 결과는 생성형 AI 시대에 지식재산권의 가치를 어떻게 평가할지에 대한 법적 선례를 남길 것입니다.
논란이 촉발된 경위
논란의 불씨는 한 주요 잡지가 대규모 언어 모델 학습에 사용된 도서, 기사, 예술 작품의 검색 가능한 목록을 공개하면서 지펴졌습니다. 수년간의 조사와 여행을 통해 논픽션 저서를 집필해 온 작가 커크 월리스 존슨에게 이 사실은 개인적인 문제였습니다. 그는 자신이 10년 동안 완벽하게 다듬어온 문장들이, 어떠한 로열티나 출처 표기 없이도 요구에 따라 자신의 문체를 재현할 수 있는 챗봇을 구동하는 데이터의 일부로 사용되고 있다는 사실을 발견했습니다.
존슨의 사례는 단독 사건이 아닙니다. 문학, 일러스트, 음악, 영화 분야의 창작자들은 자신들의 저작물이 대규모로 수집되고 있다고 보고하고 있습니다. 업계 내부자들이 '해킹된 데이터셋'의 체계적인 추출이라고 묘사하는 이 관행은 우려를 넘어 조직적인 법적 대응으로 변모했습니다. 예술가들은 이제 자신들이 창출한 가치가 창작자에게는 아무런 보상도 돌아가지 않은 채, 그들의 노동으로 이익을 얻는 '은하계 규모의 부'를 가진 테크 대기업으로 흘러 들어가고 있다고 주장합니다.
싸움의 향방을 결정짓는 소송들
이번 법적 공세는 생성형 AI 모델이 구축되는 핵심 방식을 겨냥하고 있습니다. 원고들은 저작권 침해뿐만 아니라 플랫폼 자체의 서비스 약관 위반에 대해서도 소송을 제기하고 있습니다. 인터넷 문화의 필수 요소가 된 작품을 선보여 온 일러스트레이터이자 만화가인 사라 앤더슨(Sarah Andersen)은 AI 기업을 상대로 직접적인 소송을 제기한 최초의 시각 예술가 중 한 명입니다. 그녀의 소장에 따르면, 모델이 그녀 특유의 화풍과 유머를 모방하는 능력은 그녀의 독창적인 만화 시장을 잠식하며, 결과적으로 그녀의 브랜드를 누구나 마음대로 쓸 수 있는 자원으로 전락시키고 있습니다.
이 사건들은 지식재산권 분쟁 전문 변호사들이 맡고 있으며, 이들은 거대 기술 기업에 맞서 싸워온 경력을 보유하고 있습니다. 이들의 전략은 사용된 정확한 데이터셋을 강제로 공개(discovery)하도록 하고, 기업들이 분쟁 중인 자료의 사용을 중단하도록 강제하며, 도용된 콘텐츠의 상업적 가치를 반영한 손해 배상을 청구하는 것입니다.
도전에 직면한 "공정 이용(fair use)" 논리
AI 개발자들은 공개적으로 사용 가능한 데이터를 통해 모델을 학습시키는 것이 법적으로 보호받는 '변형적 이용(transformative use)'이라고 주장합니다. 그들은 모델이 단일 저작물을 그대로 복제하는 것이 아니라, 새로운 텍스트나 이미지를 생성할 수 있도록 패턴을 학습하는 것이라고 항변합니다. 이러한 관점에서 보면, 이 과정은 저작물을 복사하는 것이 아니라 연구자가 통찰력을 얻기 위해 수많은 책을 읽는 것과 유사합니다.
창작자들은 결과물이 작가의 어조나 예술가의 화풍을 거의 그대로 복제할 수 있다면, '변형'이라는 주장은 빈약한 변명에 불과하다고 반박합니다. 챗봇이 소설가 특유의 어조와 표현으로 질문에 답하거나, 이미지 생성기가 현직 일러스트레이터의 포트폴리오와 구별할 수 없는 그림을 만들어낼 때, 그 결과물은 시장 대체재로서 기능하게 됩니다. 원고들은 이러한 대체 행위가 도서 판매, 작업 의뢰(commission), 라이선스 계약 능력을 저해하며, '공정 이용' 방어 논리는 상업적 영향력이라는 무게를 견디지 못하고 무너질 것이라고 주장합니다.
향후 관건
AI 기업에 가해지는 경제적 압박 – 법원이 대규모 스크래핑을 저작권 침해로 판결할 경우, 기업들은 상당한 재정적 타격을 입을 수 있으며, 이는 잠재적으로 데이터 파이프라인의 변화를 촉발할 수 있습니다.
법원 제출 서류 및 증거 개시(discovery) – 다음 단계로 공개될 문서들은 정확히 어떤 제목과 이미지가 사용되었는지를 밝혀냄으로써, 데이터 수집의 규모를 더욱 명확하게 보여줄 것입니다.
