Anthropic चा $१.५ अब्ज डॉलर्सचा पायरेसी सेटलमेंट: एक विक्रमी तोटा आणि धोरणात्मक विजय

आपल्या मॉडेल्सना प्रशिक्षित करण्यासाठी पायरेटेड डेटाबेस वापरल्याच्या आरोपांनंतर, Anthropic ने पुस्तकांच्या लेखकांच्या एका गटासोबत $१.५ अब्ज डॉलर्सचा ऐतिहासिक सेटलमेंट केला आहे. हे प्रचंड मोठे पेमेंट आर्थिकदृष्ट्या मोठा धक्का असला तरी, या प्रकरणातील कायदेशीर बारकावे 'फेअर युज' (fair use) च्या संदर्भात संपूर्ण AI उद्योगासाठी एक महत्त्वपूर्ण विजय ठरू शकतात.

विक्रमी सेटलमेंटचा तपशील

२०२१ आणि २०२२ दरम्यान Anthropic ने LibGen आणि PiLiMi सारख्या कुप्रसिद्ध पायरेसी डेटाबेसमधून पुस्तके डाउनलोड केल्याचे पुरावे समोर आल्यानंतर, सॅन फ्रान्सिस्कोच्या फेडरल कोर्टाने या ऐतिहासिक सेटलमेंटला मंजुरी दिली आहे. या सेटलमेंटचा विस्तार क्लास ॲक्शन (class action) इतिहासात अभूतपूर्व असून, यामध्ये अंदाजे ४,८२,४६० सूचीबद्ध कलाकृतींचा समावेश आहे.

एकूण समाविष्ट कलाकृतींपैकी ९१.३ टक्के कलाकृतींवर लेखकांनी यशस्वीरित्या दावा केला आहे. प्रत्येक दावेदाराला अंदाजे $३,००० मिळतील, जी रक्कम वैधानिक किमान रकमेच्या चार पट आहे. कायदेशीर निराकरणाचा भाग म्हणून, Anthropic ला या काळात वापरल्या गेलेल्या पायरेटेड फाईल्स नष्ट करणे आवश्यक आहे. महत्त्वाचे म्हणजे, हा सेटलमेंट कंपनीला पूर्णपणे मोकळी चिट्ठी देत नाही; जर AI आउटपुटने मूळ कलाकृतींची पुनरावृत्ती केली किंवा Anthronic च्या भविष्यातील डेटा संकलनाच्या पद्धती कॉपीराइट कायद्यांचे उल्लंघन केल्या, तर लेखकांना दावे करण्याचा अधिकार कायम राहील.

AI विकासाच्या बाजूने झुकणारी एक तांत्रिक बाब

$१.५ अब्ज डॉलर्सचा मोठा खर्च असूनही, या प्रकरणाने निर्माण केलेला कायदेशीर नजीर (precedent) AI लॅब्ससाठी आश्चर्यकारकपणे अनुकूल आहे. हा सेटलमेंट केवळ पायरेटेड स्त्रोत वापरण्याच्या विशिष्ट कृत्याशी संबंधित आहे, परंतु तो AI ट्रेनिंगच्या कायदेशीरतेवर कोणताही निर्णय देत नाही.

जज अल्सप यांनी यापूर्वी एक महत्त्वाचा फरक स्पष्ट केला होता: कायदेशीररित्या प्राप्त केलेल्या पुस्तकांवर AI ला प्रशिक्षित करणे हे "transformative—अत्यंत प्रभावीपणे" (spectacularly so) आहे आणि ते थेट 'फेअर युज'च्या सिद्धांतांतर्गत येते. हा फरक OpenAI, Google आणि Meta सारख्या कंपन्यांसाठी अत्यंत महत्त्वाचा आहे. याचा अर्थ असा की, जरी डेटाचा स्त्रोत (पायरेसी विरुद्ध कायदेशीर संपादन) ही एक जबाबदारी (liability) असली, तरी भाषा आणि नमुने समजून घेण्यासाठी मॉडेलला प्रशिक्षित करण्याची प्रक्रिया कायदेशीररित्या समर्थनीय आहे.

मास स्क्रॅपिंगचे (Mass Scraping) अनसुललेले आव्हान

जरी हा निकाल मोठ्या डेटासेटवर प्रशिक्षित केलेल्या लॅब्ससाठी एक दिलासा देणारा असला, तरी "कायदेशीर संपादन" (legal acquisition) वरील कायदेशीर लढाई अजून संपलेली नाही. मुख्य प्रश्न असा आहे की: वेबसाइट मालकांच्या स्पष्ट संमतीशिवाय इंटरनेटवरील मजकुराचे मास स्क्रॅपिंग करणे हे कायदेशीर संपादन आहे की कॉपीराइटचे उल्लंघन?

हा सेटलमेंट AI उद्योगासाठी एका दुभंगलेल्या कायदेशीर वास्तवावर प्रकाश टाकतो. कंपन्या त्यांच्या डेटा पाइपलाईन्समधून ज्ञात पायरेटेड रिपॉझिटरीज काढून टाकून मोठ्या दंडांपासून वाचू शकतात, परंतु वेब प्रकाशक आणि कंटेंट क्रिएटर्सच्या हक्कांच्या बाबतीत त्यांना अजूनही अनिश्चिततेचा सामना करावा लागेल. जसजसे AI लॅब्स विस्तारत जातील, तसतसे परिवर्तनात्मक तांत्रिक प्रगती आणि बौद्धिक संपदा अधिकार (intellectual property rights) यांच्यातील तणाव हा या उद्योगातील सर्वात मोठा कायदेशीर अडथळा राहील.

मुख्य निष्कर्ष

  • विक्रमी पेमेंट: LibGen सारख्या पायरेटेड डेटाबेसचा वापर केल्यामुळे Anthropic लेखकांना $१.५ अब्ज डॉलर्स देईल, जे क्लास ॲक्शन इतिहासातील सर्वात मोठे कॉपीराइट सेटलमेंट आहे.
  • फेअर युजचा नजीर: कायदेशीररित्या प्राप्त केलेल्या डेटावर AI ला प्रशिक्षित करणे हे "spectacularly transformative" आहे, असे न्यायालयाने मान्य केले आहे, ज्यामुळे कायदेशीर AI ट्रेनिंगला मोठा कायदेशीर आधार मिळाला आहे.
  • डेटाची अखंडता (Data Integrity) अत्यंत महत्त्वाची आहे: हा निकाल यावर भर देतो की AI ट्रेनिंगची कायदेशीरता ही ट्रेनिंग प्रक्रियेपेक्षा प्रशिक्षण डेटाच्या उगमस्थानावर (provenance) अवलंबून असते.