NYT oskarża OpenAI o ukrywanie dowodów w głośnym procesie o prawa autorskie
Trwająca batalia prawna między The New York Times a OpenAI przybrała dramatyczny obrót. Pojawiły się oskarżenia, że gigant AI celowo zatajał dowody dotyczące zestawów danych wykorzystywanych do trenowania modeli. Eskalacja ta grozi przesunięciem punktu ciężkości procesu z naruszenia praw autorskich na rzetelność procesu ujawniania dowodów (discovery process).
Oskarżenia o stosowanie zwodniczych praktyk dotyczących danych
The New York Times oraz The Daily News twierdzą, że OpenAI nie mówiła prawdy na temat swoich technicznych możliwości przeszukiwania zarówno korpusu treningowego, jak i logów czatów klientów. W trakcie dwuletniego procesu OpenAI utrzymywała, że przeszukiwanie ogromnych zbiorów danych byłoby technicznie uciążliwe i naruszałoby prywatność użytkowników.
Jednak niedawne zeznania inżyniera ds. prywatności danych w OpenAI, Vinniego Monaco, podważyły tę narrację. Monaco miał ujawnić, że OpenAI przeprowadziła już wewnętrzne przeszukiwania swojego korpusu treningowego w celu zidentyfikowania chronionych prawem autorskim prac dziennikarskich. Co więcej, z zeznań wynika, że OpenAI zgromadziła bazę danych zawierającą około 78 milionów zanonimizowanych rozmów z ChatGPT, aby wewnętrznie ocenić skalę potencjalnego naruszenia praw autorskich.
Project Giraffe i filtr „Bloom”
Być może najważniejszym technicznym odkryciem jest „Project Giraffe” – zestaw narzędzi wdrożonych przez OpenAI. Według powodów, krótko po wniesieniu pozwu, OpenAI wykorzystała w ramach tego projektu filtr „Bloom”, aby wykrywać i rejestrować przypadki „regurgitacji” (regurgitation) – czyli sytuacji, w których model powiela chronioną treścią informację słowo w słowo w swoich odpowiedziach.
Istnienie Project Giraffe przeczy wcześniejszemu stanowisku OpenAI, według którego identyfikacja konkretnych przypadków powielania treści w logach była zadaniem niemożliwym do wykonania. Powodowie argumentują, że narzędzia te dowodzą, iż OpenAI nie tylko była zdolna do monitorowania naruszeń praw autorskich, ale aktywnie budowała infrastrukturę do ich śledzenia.
Spory o integralność danych i proces ujawniania dowodów
Konflikt koncentruje się również na jakości danych dostarczonych do sądu. Podczas gdy powodowie pierwotnie wnioskowali o próbkę 120 milionów logów czatów, OpenAI wynegocjowała zmniejszenie tej liczby do 20 milionów. Gdy próbka została ostatecznie przedłożona w grudniu, sąd uznał ją rzekomo za „nieprzydatną” ze względu na nadmierne redagowanie (wymazywanie) treści.
NYT poszło o krok dalej, twierdząc, że OpenAI usunęła miliardy odpowiedzi ChatGPT wbrew sądowemu nakazowi zachowania danych (preservation order) i podmieniła miliony logów w dostarczonej próbce. W odpowiedzi rzecznik OpenAI, Drew Pusateri, zaprzeczył wszystkim oskarżeniom, zarzucając „Timesom” próbę naruszenia prywatności użytkowników w obliczu słabnącej pozycji ich sprawy prawnej.
Dlaczego ma to znaczenie dla branży AI
Sprawa ta jest wyznacznikiem dla przyszłości rozwoju generatywnej sztucznej inteligencji oraz prawnych granic „dozwolonego użytku” (fair use). Jeśli sąd uzna, że OpenAI zatajała dowody lub manipulowała procesem ujawniania danych, może to stworzyć precedens określający, w jaki sposób firmy AI będą zobowiązane do ujawniania swoich metodologii trenowania i pochodzenia danych (data lineage). Dla programistów i założycieli startupów AI wynik procesu wyjaśni poziom przejrzystości wymagany na styku masowego przetwarzania danych i praw własności intelektualnej.
Kluczowe wnioski
- Narzędzia do wewnętrznego monitorowania: Oskarżenia sugerują, że OpenAI używała „Project Giraffe” i filtra „Bloom”, aby aktywnie śledzić powielanie chronionych treści.
- Sprzeczne zeznania: Dowody z zeznań sugerują, że OpenAI posiadała techniczne możliwości przeszukiwania swoich danych treningowych, co przeczy wcześniejszym twierdzeniom o nadmiernym obciążeniu technicznym.
- Integralność procesu ujawniania dowodów zagrożona: Powództwo zależy teraz od tego, czy OpenAI naruszyła nakazy zachowania danych poprzez usuwanie odpowiedzi i dostarczanie „nieprzydatnych”, zredagowanych próbek danych.
