हा खटला न्यायालयात का पोहोचला

ऑगस्ट आणि सप्टेंबर २०२४ मध्ये प्रकाशित झालेल्या स्वतःच्या लेखांशी साम्य असल्याचे पाहून ANI ने दावा केला की ChatGPT अलीकडील भारतीय बातम्यांच्या प्रश्नांची उत्तरे देताना त्यांच्या लेखांची नक्कल करत आहे. या एजन्सीने असा युक्तिवाद केला की हे लार्ज लँग्वेज मॉडेल (LLM) त्यांच्या कॉपीराइट असलेल्या मजकुराची पुनरावृत्ती करत आहे. जर हा दावा मान्य झाला, तर OpenAI ला भारतात आपली मॉडेल्स थांबवावी लागतील किंवा त्यावर कडक निर्बंध घालावे लागतील.

OpenAI ने उत्तर दिले की, उल्लेख केलेली दोन मॉडेल्स—GPT-4 आणि नवीन GPT-4o—यांना एप्रिल २०२२ आणि एप्रिल २०२४ च्या 'कट-ऑफ' तारखेपर्यंतच्या डेटावर प्रशिक्षित करण्यात आले होते. ANI चे लेख या तारखांनंतर प्रकाशित झाले होते, त्यामुळे ते मूळ प्रशिक्षण संचामध्ये (training set) असणे शक्य नव्हते. न्यायाधीश अमित बन्सल यांनी म्हटले की, हा साम्य बहुधा 'रिट्रिव्हल-ऑगमेंटेड जनरेशन' (RAG) मुळे आला असावा, जे रिअल-टाइममध्ये वेबवरील चालू मजकूर प्रतिसादात आणते, मॉडेलने लेख "लक्षात ठेवल्यामुळे" (remembering) नाही.

कायदेशीर वळण: प्रशिक्षण म्हणजे "संशोधन"

हा खटला महत्त्वाचा आहे कारण न्यायालयाने "संशोधनासह खाजगी किंवा वैयक्तिक वापरासाठी" असलेल्या भारताच्या कॉपीराइट अपवादाचा व्यापक अर्थ लावला आहे. दोन्ही बाजूंनी मान्य केले की OpenAI ने सुरुवातीच्या प्रशिक्षण टप्प्यात ANI च्या साहित्याचा वापर केला होता, परंतु न्यायाधीशांनी त्या वापराला "transformative" (परिवर्तनकारी) मानले. दुसऱ्या शब्दांत, मॉडेलने केवळ व्याकरण, वाक्यरचना आणि सांख्यिकीय नमुने (statistical patterns) काढले, मूळ अभिव्यक्ती मजकूर तसाच ठेवला.

न्यायालयाने दोन कडक अटी घातल्या:

  • प्रशिक्षणासाठी वापरल्या जाणाऱ्या प्रती कायदेशीर स्रोतांकडूनच असाव्यात, पायरेटेड आर्काइव्ह किंवा वापरकर्त्याला प्रवेश न मिळणाऱ्या 'पेवॉल' (paywalls) मधून नसाव्यात.
  • हे साहित्य डेव्हलपरच्या स्वतःच्या वातावरणापुरते (environment) मर्यादित असले पाहिजे; ते प्रकाशित किंवा वितरित करता येणार नाही.

तीन भागांच्या 'fairness test' चा वापर करून, न्यायाधीशांनी असे आढळले की OpenAI चा वापर केवळ प्रशिक्षणापुरता मर्यादित होता, मॉडेलने शब्दशः उतारे लक्षात ठेवल्याचा कोणताही पुरावा आढळला नाही आणि ANI चे कोणतेही थेट आर्थिक नुकसान झाले नाही, कारण दोन्ही कंपन्या वेगवेगळ्या बाजारपेठांमध्ये कार्यरत आहेत.

जागतिक निकालांच्या संदर्भात याचे महत्त्व

भारताची भूमिका आता अमेरिकेतील अनेक प्रकरणांशी सुसंगत आहे, जी AI आउटपुटच्या 'transformative' दृष्टिकोनाचे समर्थन करतात. Kadrey v. Meta मध्ये, न्यायालयाने असे ठरवले की तयार केलेला मजकूर जर शब्दशः कॉपी करत नसेल, तर तो कॉपीराइटचे उल्लंघन करत नाही; तर दीर्घकालीन Google Books च्या निर्णयाने डिजिटायझेशन प्रकल्पांसाठी मर्यादित "search-and-display" अपवाद मान्य केला आहे. Raw Story सारख्या इतर अमेरिकन दाव्यांना सिद्ध करता येण्याजोगे नुकसान नसल्यामुळे फेटाळण्यात आले, परंतु Anthropic वादाने न्यायाधीशांना आठवण करून दिली की पायरेटेड डेटा वापरल्यामुळे जबाबदारी (liability) निर्माण होऊ शकते.

संपूर्ण युरोपमध्ये यावर भिन्न मते आहेत. म्युनिकमधील न्यायालयांनी असा निर्णय दिला आहे की मॉडेल वेट्समध्ये (model weights) समाविष्ट असलेले गाण्याचे बोल (lyrics) पुनरुत्पादित करणे हे उल्लंघन आहे, तर लंडनच्या न्यायाधिकरणाने अलीकडेच Stability AI विरुद्धचा दावा तत्सम कारणास्तव फेटाळला आहे. दिल्ली उच्च न्यायालयाचा निर्णय आणखी एक महत्त्वाचा मुद्दा मांडतो: जर प्रशिक्षण कायदेशीर स्रोतांपुरते मर्यादित असेल आणि आउटपुट शब्दशः प्रत नसेल, तर ही क्रिया संशोधनाच्या अपवादांतर्गत येऊ शकते.

डेव्हलपर्सनी कोणत्या गोष्टींकडे लक्ष दिले पाहिजे

  • RAG विरुद्ध प्रशिक्षण – "स्मरणशक्ती" (प्रशिक्षण) आणि रिअल-टाइम रिट्रिव्हल (RAG) मधील न्यायालयाचा फरक असे सुचवतो की भविष्यातील वाद यावर केंद्रित असतील की उत्तर स्थिर ज्ञानकोशातून (static knowledge base) येते की वेबवरून थेट मिळवले जाते. डेव्हलपर्सना त्यांच्या उत्पादन दस्तऐवजात (product documentation) ही रेषा अधिक स्पष्ट करण्याची आवश्यकता भासू शकते.
  • स्त्रोतांची वैधता (Source provenance) – "कायदेशीर स्रोत" या आवश्यकतेमुळे कंपन्यांना डेटा-क्युरेशन पाइपलाइन अधिक कडक कराव्या लागतील, ज्यामध्ये प्रत्येक मजकूर वैध असल्याचे सिद्ध करण्यासाठी करार किंवा परवान्यांचा वापर केला जाईल.
  • केवळ अंतर्गत वापर – मॉडेल आउटपुटचे व्यापारीकरण करण्याचा विचार करणाऱ्या कंपन्यांनी प्रशिक्षण डेटा केवळ अंतर्गतच ठेवला पाहिजे. भागीदार किंवा जनतेसोबत कच्चा डेटा (raw corpora) शेअर केल्यास संशोधनाचा बचाव कमकुवत होऊ शकतो.
  • आर्थिक-नुकसान चाचणी – न्यायालयाने थेट आर्थिक नुकसानीच्या अभावावर भर दिला असल्यामुळे, दावेदारांना केवळ ब्रँडची प्रतिष्ठा कमी झाल्याचे न सांगता प्रत्यक्ष नुकसान दाखवावे लागेल.
  • कायदेमंडळाचा प्रतिसाद – भारतीय कायदेमंडळ AI-संबंधित कॉपीराइट वादांवर लक्ष ठेवून आहे. संशोधनाचा अपवाद मर्यादित करणारा कोणताही सुधारणा (amendment) आधीच तैनात केलेल्या मॉडेल्सवर उलट परिणाम करू शकतो, ज्यामुळे अनुपालन ऑडिटची (compliance audits) लाट येऊ शकते.

AI समोर असलेला विरोधाभासी युक्तिवाद

ANI च्या तक्रारीने एका खऱ्या चिंतेवर प्रकाश टाकला आहे: जसजसे LLMs विशिष्ट शब्दरचना वापरण्यात अधिक सक्षम होत आहेत, तसतसे "transformative" वापर आणि "copy" यातील रेषा धूसर होऊ शकते. टीकाकारांचा असा युक्तिवाद आहे की RAG तांत्रिकदृष्ट्या शोध कार्य (search function) असले तरी, ते परवानगीशिवाय कॉपीराइट सामग्री समोर आणते, ज्यामुळे "जनतेला माहिती देण्याच्या" (communication to the public) अधिकाराचे उल्लंघन होऊ शकते.

जागतिक स्तरावर परिणाम घडवून आणणारा एक कायदेशीर पूर्वोद (Precedent)

मॉडेल ट्रेनिंगला एक परवानगीयोग्य संशोधन उपक्रम म्हणून वर्गीकृत करून, दिल्ली उच्च न्यायालयाने असे संकेत दिले आहेत की, जर डेव्हलपर्सनी स्त्रोतांच्या कायदेशीरतेचा आदर राखला आणि ट्रेनिंग अंतर्गत ठेवले, तर भारत कॉपीराइटच्या आधारावर लार्ज लँग्वेज मॉडेल्सच्या विकासाला आपोआप रोखणार नाही. या निर्णयामुळे कंपन्यांना त्यांच्या भारतीय कामकाजात विस्तार करण्यास प्रोत्साहन मिळू शकते, कारण त्यांना आता एक महत्त्वाचा कायदेशीर अडथळा कमी झाल्याचे समजले आहे.

इतर ठिकाणच्या नियामकांसाठी, हा निकाल एक नमुना (template) प्रदान करतो: संशोधनासाठी एक मर्यादित आणि व्यवस्थित दस्तऐवजीकरण केलेले अपवाद ठरवणे, स्त्रोतांसाठी स्पष्ट मानके लागू करणे आणि ट्रेनिंग डेटाची केवळ अंतर्गत हाताळणी करणे अनिवार्य करणे. जे देश अशाच प्रकारची धोरणे स्वीकारतील, ते त्यांच्या देशांतर्गत AI परिसंस्थेला गुंतवणूक आकर्षित करण्यासाठी आवश्यक असलेली निश्चितता देऊ शकतील.

थोडक्यात सांगायचे तर: दिल्ली उच्च न्यायालयाच्या निर्णयामुळे AI ट्रेनिंगसाठी कोणताही मजकूर स्क्रॅप करण्यासाठी अमर्याद अधिकार मिळत नाहीत, परंतु भारतीय कायद्यांतर्गत, शिस्तबद्ध आणि कायद्याचे पालन करणारे ट्रेनिंग हे संशोधनामध्ये मोडते, हे या निर्णयाने प्रस्थापित केले आहे. यंत्रांना भाषा समजून शिकवणे हा एक संरक्षित शैक्षणिक उपक्रम आहे की ते कॉपीराइटचे उल्लंघन आहे, या प्रश्नाशी जगभरातील न्यायालये संघर्ष करत असताना, ही व्याख्या एक संदर्भ बिंदू ठरू शकते.