Dlaczego sprawa trafiła do sądu

ANI pozwała firmę po zauważeniu, że odpowiedzi ChatGPT na zapytania dotyczące ostatnich wiadomości z Indii przypominały jej własne artykuły opublikowane w sierpniu i wrześniu 2024 roku. Agencja argumentowała, że duży model językowy powiela jej chronione prawem autorskim teksty – roszczenie to, jeśli zostanie podtrzymane, zmusiłoby OpenAI do wstrzymania lub znacznego ograniczenia działania swoich modeli w Indiach.

OpenAI odpowiedziało, że dwa przywołane modele — GPT-4 oraz nowszy GPT-4o — zostały wytrenowane na danych z datami odcięcia (cut-off dates) przypadającymi na kwiecień 2022 i kwiecień 2024 roku. Artykuły ANI pojawiły się po tych datach, więc nie mogły znajdować się w oryginalnym zbiorze treningowym. Sędzia Amit Bansal stwierdził, że podobieństwo najprawdopodobniej wynika z Retrieval-Augmented Generation (RAG), który w czasie rzeczywistym pobiera aktualne treści z sieci do odpowiedzi, a nie z „pamięci” modelu dotyczącej artykułów.

Zwrot prawny: trenowanie jako „badania”

Sprawa jest istotna, ponieważ sąd szeroko zinterpretował indyjskie wyłączenie praw autorskich dla „użytku prywatnego lub osobistego, w tym badań”. Obie strony zgodziły się, że OpenAI wykorzystało materiały ANI podczas początkowej fazy trenowania, jednak sędzia uznał to wykorzystanie za „transformatywne”. Innymi słowy, model wyodrębnił jedynie gramatykę, składnię i wzorce statystyczne, pozostawiając treść ekspresyjną nienaruszoną.

Sąd wyznaczył dwa surowe warunki:

  • Kopie wykorzystywane do trenowania muszą pochodzić z legalnych źródeł, a nie z pirackich archiwów czy systemów paywall, do których użytkownik nie ma dostępu.
  • Materiał musi pozostać wewnątrz własnego środowiska dewelopera; nie może być publikowany ani rozpowszechniany.

Stosując trójstopniowy test uczciwości, sędzia uznał, że wykorzystanie przez OpenAI ograniczało się do trenowania, nie znalazł dowodów na to, że model zapamiętywał fragmenty słowo w słowo, i zauważył, że ANI nie poniosło bezpośredniej straty ekonomicznej, ponieważ obie firmy działają w innych segmentach rynku.

Jak to się ma do mozaiki globalnych orzeczeń

Stanowisko Indii odzwierciedla obecnie kilka spraw w USA, które sprzyjają transformatywnemu podejściu do wyników działania AI. W sprawie Kadrey v. Meta sąd uznał, że wygenerowany tekst, który nie kopiuje dokładnego brzmienia słów, nie narusza praw autorskich, podczas gdy wieloletnia decyzja w sprawie Google Books uznała ograniczony wyjątek „wyszukiwania i wyświetlania” dla projektów digitalizacji. Inne pozwy w USA, takie jak sprawa Raw Story, zostały oddalone z powodu braku wykazalnej szkody, ale kontrowersja wokół Anthropic przypomniała sędziom, że korzystanie z pirackich danych wciąż może rodzić odpowiedzialność prawną.

W Europie opinie są wyraźnie podzielone. Sądy w Monachium orzekły, że powielanie tekstów piosenek zawartych w wagach modelu stanowi naruszenie, podczas gdy londyński trybunał niedawno oddalił roszczenie przeciwko Stability AI na podobnych podstawach. Orzeczenie Sądu Najwyższego w Delhi dodaje kolejny punkt danych: jeśli trenowanie ogranicza się do legalnych źródeł, a wynik nie jest dosłowną kopią, działalność ta może mieścić się w wyjątku badawczym.

Na co powinni zwrócić uwagę deweloperzy

  • RAG vs. trenowanie – Rozróżnienie dokonane przez sąd między „zapamiętywaniem” (trenowaniem) a pobieraniem w czasie rzeczywistym (RAG) sugeruje, że przyszłe spory będą koncentrować się na tym, czy odpowiedź pochodzi ze statycznej bazy wiedzy, czy jest pobierana na żywo z sieci. Deweloperzy mogą potrzebować wyraźniejszego rozgraniczenia tej kwestii w dokumentacji produktu.
  • Pochodzenie źródeł – Wymóg korzystania z „legalnych źródeł” może skłonić firmy do uszczelnienia procesów kurateli danych (data curation), poprzez stosowanie kontraktów lub licencji potwierdzających, że każdy fragment tekstu jest legalny.
  • Wykorzystanie wyłącznie wewnętrzne – Firmy planujące komercjalizację wyników działania modeli muszą ściśle trzymać dane treningowe wewnątrz organizacji. Udostępnianie surowych korpusów partnerom lub opinii publicznej może osłabić możliwość powołania się na wyjątek badawczy.
  • Test szkody ekonomicznej – Ponieważ sąd położył nacisk na brak bezpośredniej szkody finansowej, powód będzie musiał wykazać konkretną stratę, a nie tylko postrzegane osłabienie marki.
  • Reakcja ustawodawcza – Indyjscy ustawodawcy monitorują debaty dotyczące praw autorskich w kontekście AI. Każda nowelizacja ograniczająca wyjątek badawczy może zadziałać wstecz na modele już wdrożone, co wywoła falę audytów zgodności.

Kontrargument, który wciąż dręczy AI

Skarga ANI uwypukliła autentyczną obawę: w miarę jak modele LLM stają się coraz sprawniejsze w powtarzaniu specyficznych sformułowań, granica między użyciem „transformatywnym” a „kopią” może się zacierać. Krytycy argumentują, że RAG, choć technicznie jest funkcją wyszukiwania, wciąż przywołuje chronione treści bez zezwolenia, co potencjalnie narusza prawo do „publicznego udostępniania”.

Precedens o światowych skutkach

Klasyfikując trenowanie modeli jako dopuszczalną działalność badawczą, Wysoki Sąd w Delhi zasygnalizował, że Indie nie będą automatycznie blokować rozwoju dużych modeli językowych ze względu na prawa autorskie, pod warunkiem, że programiści będą przestrzegać legalności źródeł i zachowają proces trenowania wewnątrz organizacji. Taka interpretacja może zachęcić firmy do rozszerzania swojej działalności w Indiach, wiedząc, że kluczowa przeszkoda prawna uległa złagodzeniu.

Dla regulatorów w innych miejscach orzeczenie to stanowi wzorzec: zdefiniować wąski, dobrze udokumentowany wyjątek badawczy, narzucić jasne standardy pozyskiwania danych oraz wymagać, aby dane treningowe były przetwarzane wyłącznie wewnątrz organizacji. Kraje, które przyjmą podobne sformułowania, mogą zapewnić swoim krajowym ekosystemom AI pewność niezbędną do przyciągnięcia inwestycji.

Podsumowując: Decyzja Wysokiego Sądu w Delhi nie daje „carte blanche” na scrapowanie dowolnych tekstów do trenowania AI, ale ustanawia, że zgodnie z indyjskim prawem, zdyscyplinowane i zgodne z przepisami trenowanie kwalifikuje się jako działalność badawcza. Interpretacja ta może stać się punktem odniesienia dla sądów na całym świecie, które zmagają się z pytaniem, czy uczenie maszyn rozumienia języka jest chronioną działalnością naukową, czy też naruszeniem prawa czekającym na zaistnienie.