AI Gemini od Google mierzy się z pozwem zbiorowym wniesionym do federalnego sądu w Nowym Jorku, w którym oskarża się firmę o trenowanie swoich modeli na chronionych prawem autorskim książkach i artykułach bez zezwolenia. Skarga, wniesiona przez koalicję obejmującą dużych wydawców i autora Scotta Turowa, twierdzi, że Google celowo usunęło informacje o prawach autorskich, aby ukryć wykorzystanie „skradzionych materiałów” w swoim systemie generatywnej sztucznej inteligencji.
Pozew i jego główne zarzuty
Pozew w Sądzie Okręgowym USA dla Południowego Okręgu Nowego Jorku wymienia Hachette, Cencage, Elsevier, kolektyw S.C.R.I.B.E. oraz Turowa jako powodów. Twierdzą oni, że Google wyszło poza ramy porozumienia typu „tylko fragmenty” (snippet-only), które obowiązywało w przypadku Google Books, wykorzystując pełnotekstowe dzieła z tego archiwum oraz z tytułów przesłanych do Google Play do trenowania Gemini. Według skargi Google nie tylko pobrało treść (scraping), ale także zmodyfikowało lub usunęło metadane dotyczące praw autorskich – krok, który zdaniem powodów miał na celu ukrycie naruszenia.
Wewnętrzna notatka Google przywołana w pozwie ostrzega, że wykorzystywanie chronionych prawem autorskim książek do trenowania AI może być „wysoce problematyczne” i narazić firmę na kary w wysokości od 10 do 100 miliardów dolarów. Powodowie wskazują na niedawną karę w wysokości 1,5 miliarda dolarów nałożoną na inną firmę z branży AI za nieautoryzowane wykorzystanie danych jako punkt odniesienia dla skali potencjalnej odpowiedzialności.
Jak do tego doszło
Relacje Google z wydawcami książek rozpoczęły się od Google Books – przeszukiwalnego indeksu, który wyświetlał krótkie fragmenty i szczegóły bibliograficzne, pozostawiając pełny tekst za paywallem. Model ten opierał się na umowach licencyjnych, które ograniczały Google do wyświetlania fragmentów. Na przestrzeni lat Google rozszerzyło swoje zasoby poprzez sklep Google Play, gdzie wydawcy i autorzy przesyłają e-booki w pełnej wersji do sprzedaży.
Powodowie argumentują, że przejście Google od usługi indeksowania o „ograniczonym zakresie” do źródła danych służącego do trenowania dużych modeli językowych (LLM) narusza pierwotne umowy. Twierdzą, że firma nigdy nie uzyskała szerokich zgód niezbędnych do wprowadzenia całych dzieł do procesu trenowania Gemini.
Co jest stawką dla Google i branży AI
Jeśli sąd uzna, że wykorzystywanie chronionego materiału bez licencji narusza prawo autorskie, decyzja ta może zmienić sposób, w jaki twórcy AI gromadzą dane treningowe.
Możliwe linie obrony i kontrargumenty
Google prawdopodobnie oprze swoją obronę na doktrynie „fair use” (dozwolonego użytku), która pozwala na ograniczony użytek chronionego materiału w celach komentarza, krytyki lub transformacji. Niedawne orzeczenia w Kalifornii traktowały trenowanie AI jako działalność transformatywną, przyznając jej ochronę w ramach fair use. Powodowie z Nowego Jorku złożyli pozew poza tą jurysdykcją, aby uniknąć tych precedensów.
Powodowie odpowiadają, że usunięcie metadanych o prawach autorskich świadczy o zamiarze ukrycia źródła, co podważa wszelkie twierdzenia o transformacji dokonywanej w dobrej wierze. Powołują się również na wewnętrzną notatkę jako dowód na to, że Google rozpoznawało ryzyko prawne.
Na co warto zwrócić uwagę w następnej kolejności
Sprawa przejdzie przez fazę wniosków przedprocesowych, które mogą ukształtować argumentację obu stron, w tym to, czy sąd zastosuje analizę fair use stosowaną w Kalifornii, czy przyjmie inny standard. Orzeczenie dotyczące jurysdykcji może zdecydować, czy sądy w Nowym Jorku staną się głównym miejscem rozstrzygania sporów o prawa autorskie związanych z AI.
Podsumowując: Pozew w Nowym Jorku przeciwko Gemini od Google może wyznaczyć nową granicę między dopuszczalnym wykorzystaniem danych a naruszeniem praw autorskich, zmuszając twórców AI do przemyślenia sposobu pozyskiwania surowca zasilającego ich modele i zmieniając ekonomię całej branży.
