अमेरिकेच्या न्याय विभागाने (US Department of Justice) मीडिया क्षेत्रातील दिग्गज कंपन्या आणि AI डेव्हलपर्स यांच्यातील सुरू असलेल्या कॉपीराइट युद्धांमध्ये एक महत्त्वपूर्ण कायदेशीर हस्तक्षेप केला आहे. Large Language Models (LLMs) ला कॉपीराइट केलेल्या डेटावर प्रशिक्षित करणे हे "fair use" (वाजवी वापर) मानले जाते, असा युक्तिवाद करून DOJ ने OpenAI आणि Microsoft सारख्या कंपन्यांना एक मोठा कायदेशीर बचाव प्रदान केला आहे.

DOJ चा युक्तिवाद: प्रशिक्षण विरुद्ध आउटपुट (Training vs. Output)

The New York Times संबंधित एकत्रित खटल्याच्या केंद्रस्थानी AI कशा प्रकारे शिकते आणि ते काय तयार करते, यामधील मूलभूत फरक आहे. The New York Times ने असा आरोप केला आहे की, GPT-4 सारख्या मॉडेल्सना प्रशिक्षित करण्यासाठी त्यांच्या कोट्यवधी लेखांचा परवानगीशिवाय वापर करण्यात आला, ज्यामुळे अब्जावधी डॉलर्सचे नुकसान झाले असून वर्तमानपत्राशी थेट स्पर्धा करणारे उत्पादन तयार झाले आहे.

तथापि, DOJ च्या अलीकडील अर्जामध्ये असा युक्तिवाद करण्यात आला आहे की, कॉपीराइट उल्लंघन हे आउटपुटच्या (output) वेळी होते, डेटा ग्रहण (ingestion) करण्याच्या वेळी नाही. विभागाचे म्हणणे आहे की, प्रशिक्षण टप्प्यात संपूर्ण साहित्य कॉपी केले जात असले तरी, ही कॉपी कधीही सार्वजनिकरित्या उपलब्ध करून दिली जात नाही. शिवाय, DOJ ने असा दावा केला आहे की GPT-4 सारख्या मॉडेल्सचे आउटपुट मूळ स्रोत साहित्याशी "नेहमीच नाही तरी अनेकदा लक्षणीय साम्य दर्शवत नाहीत". प्रशिक्षण प्रक्रिया आणि तयार केलेले साहित्य (generated content) यांना वेगळे करून, DOJ मशीन लर्निंगच्या कृतीला 'मार्केट सबस्टिट्यूशन' (market substitution) या कायदेशीर संकल्पनेपासून वेगळे करण्याचा प्रयत्न करत आहे.

"हेमिंग्वे उपमा" आणि मानवी सर्जनशीलता

मशीन लर्निंगची संकल्पना समजण्यायोग्य करण्यासाठी, DOJ ने लेखिका Joan Didion यांच्या संदर्भातील एका साहित्यिक उपमेचा वापर केला. अर्जामध्ये नमूद केले आहे की, किशोरवयीन असताना, Didion त्यांच्या वाक्यांची रचना समजून घेण्यासाठी आणि त्यांचे कौशल्य शिकण्यासाठी Ernest Hemingway च्या कथा कॉपी करायच्या. DOJ चा असा युक्तिवाद आहे की, जर कायद्याने मशीन ट्रेनिंगला उल्लंघन मानले, तर Didion सारख्या लेखिकेला सैद्धांतिकदृष्ट्या प्रत्येक वेळी नवीन काम प्रकाशित करताना कायदेशीर कारवाईला सामोरे जावे लागू शकते, कारण त्यांची शिकण्याची प्रक्रिया त्यांच्या पुढील लेखनाशी अविभाज्यपणे जोडलेली असेल.

विभागाचा असाही युक्तिवाद आहे की, AI प्रशिक्षणासाठी कडक दायित्व (strict liability) लादल्यास, कॉपीराइट कायद्याचा जो उद्देश सर्जनशीलता संरक्षित करणे आहे, त्यालाच विरोधाभासी पद्धतीने बाधा येईल. मानवी घटक मूळ साहित्य तयार करण्यासाठी आणि संपादित करण्यासाठी अधिकाधिक LLMs चा वापर करत असताना, DOJ ने सुचवले आहे की, मोठ्या लायसन्सिंग योजनांशिवाय प्रशिक्षण प्रतिबंधित केल्यास AI-आधारित नाविन्यपूर्णतेला (innovation) खीळ बसेल.

DOJ ची भूमिका US Copyright Office च्या अलीकडील निष्कर्षांच्या थेट विरोधात आहे. माजी रजिस्ट्रार Shira Perlmutter यांनी यापूर्वी सर्वसमावेशक "fair use" बचावाच्या विरोधात युक्तिवाद केला होता, त्यांनी नमूद केले होते की AI मानवी क्षमतेच्या पलीकडे असलेल्या वेगाने आणि प्रमाणात कार्य करते आणि अनेकदा मूळ सामग्री निर्मात्यांशी थेट स्पर्धा करणारी व्यावसायिक उत्पादने तयार करते.

DOJ ने या मूल्यांकनावर आक्षेप घेत म्हटले आहे की, Perlmutter चा अहवाल कोणताही बंधनकारक कायदेशीर अधिकार ठेवत नाही आणि प्रत्येक प्रकरणाचे विश्लेषण करण्याबाबतच्या प्रस्थापित कायदेशीर निकालांचा (case law) विचार करण्यात तो अपयशी ठरतो. विभागाचा इशारा आहे की, व्यापक दायित्व लादल्यास प्रत्यक्षात एक लायसन्सिंग व्यवस्था अनिवार्य होईल, ज्यामुळे प्रगत AI मॉडेल्सचा विकास कायदेशीर आणि आर्थिकदृष्ट्या अशक्य होईल.

मुख्य निष्कर्ष (Key Takeaways)

  • प्रशिक्षण आणि आउटपुटचे विलगीकरण: DOJ चा असा युक्तिवाद आहे की, जर तयार झालेल्या मॉडेलचे आउटपुट मूळ साहित्याशी "लक्षणीय साम्य" (substantial similarity) दर्शवत नसेल, तर प्रशिक्षणासाठी मजकूर कॉपी करणे हे उल्लंघन मानले जाऊ शकत नाही.
  • नाविन्यपूर्णतेचे संरक्षण: विभागाचा इशारा आहे की सर्व प्रशिक्षण डेटासाठी परवाने (licenses) अनिवार्य केल्यास सर्जनशीलतेला बाधा येईल आणि मानवी सामग्री निर्मितीमध्ये मदत करणाऱ्या LLMs च्या विकासाला अडथळा येईल.
  • एक कायदेशीर सूचक (Legal Bellwether): हा हस्तक्षेप DOJ आणि US Copyright Office यांच्यात एक उच्च-धोक्याचा संघर्ष निर्माण करतो, ज्यामुळे जनरेटिव्ह AI च्या भविष्यावर निर्णायक न्यायालयीन निकालासाठी मार्ग मोकळा होईल.

लेख (ARTICLE): अमेरिकेच्या न्याय विभागाने (US Department of Justice) New York Times च्या कॉपीराइट खटल्यात एक 'अॅमिकस ब्रीफ' (amicus brief) दाखल केला आहे, ज्यामध्ये असा युक्तिवाद केला आहे की मोठ्या भाषा मॉडेल्सना (LLMs) प्रशिक्षित करण्यासाठी संरक्षित मजकूर कॉपी करणे हे 'fair use' च्या कक्षेत येते. या अर्जामुळे OpenAI आणि Microsoft सारख्या कंपन्यांना एक कायदेशीर कवच प्राप्त होऊ शकते, ज्यामुळे त्यांना वर्तमानपत्राने अब्जावधी डॉलर्सचे नुकसान असल्याचा जो अंदाज वर्तवला आहे, त्यापासून वाचवता येईल.

हा खटला आता का महत्त्वाचा आहे

या खटल्यामध्ये अनेक दावे एकत्रित केले आहेत की, AI डेव्हलपर्सनी परवानगीशिवाय कोट्यवधी वृत्तपत्रांचे लेख त्यांच्या मॉडेल्समध्ये भरले आणि त्यानंतर Times च्या स्वतःच्या रिपोर्टिंगशी थेट स्पर्धा करणारी उत्पादने बाजारात आणली. जर न्यायालयाने DOJ च्या 'fair-use' युक्तिवादाला फेटाळले, तर AI कंपन्यांना मोठ्या प्रमाणावर लायसन्सिंग बिले भरावी लागतील किंवा त्यांना पुढील पिढीच्या संवादात्मक एजंट्सचा (conversational agents) विकास थांबवण्यास भाग पाडले जाऊ शकते.

DOJ चा मुख्य युक्तिवाद

हा अर्ज AI कार्यप्रवाहाला दोन स्पष्ट टप्प्यांमध्ये विभागतो. पहिले म्हणजे, मॉडेल मोठ्या प्रमाणावरील मजकूर ग्रहण करते; दुसरे म्हणजे, ते वापरकर्त्यांच्या प्रॉम्प्ट्सना प्रतिसाद देते. विभागाचे म्हणणे आहे की, जेव्हा कॉपीराइट केलेले कार्य अशा प्रकारे पुनरुत्पादित केले जाते की जनता ते पाहू शकते, तेव्हाच उल्लंघन होते. कारण प्रशिक्षणासाठी वापरल्या जाणाऱ्या प्रती कधीही डेव्हलपरच्या सर्व्हरवरून बाहेर जात नाहीत, त्यामुळे मजकूर ग्रहण करण्याची क्रिया त्या मर्यादेपर्यंत पोहोचत नाही.

DOJ "substantial similarity" (महत्त्वपूर्ण साम्य) चाचणीवर देखील अवलंबून आहे, जी कॉपीराइटची एक जुनी मानक पद्धत आहे. त्यांचे असे म्हणणे आहे की, GPT-4 सारख्या मॉडेल्सद्वारे तयार केले जाणारे मजकूर आउटपुट "कधीकधी किंवा नेहमीच" कोणत्याही एका स्रोतापेक्षा इतके वेगळे असते की, वादी आवश्यक साम्य सिद्ध करू शकत नाही. थोडक्यात, हा अर्ज असा युक्तिवाद करतो की कायदेशीर लक्ष अंतिम आउटपुटवर असावे, अंतर्गत शिकण्याच्या प्रक्रियेवर नाही.

मुद्दा स्पष्ट करण्यासाठी एक साहित्यिक उदाहरण

तांत्रिक युक्तिवाद अधिक समजण्यासारखा करण्यासाठी, या अर्जात एका किशोरवयीन लेखिकेची कथा सांगितली आहे, जिने अर्नेस्ट हेमिंग्वेच्या लेखनशैलीचा अभ्यास करण्यासाठी त्यांच्या कथा कॉपी केल्या होत्या. DOJ म्हणते की, जर कायद्याने त्या शिकण्याच्या प्रक्रियेला उल्लंघन मानले, तर लेखिका जेव्हा जेव्हा एखादी नवीन रचना प्रकाशित करेल, तेव्हा तिच्यावर खटला भरला जाऊ शकतो, जरी तिचे काम मूळ असले तरीही. विभाग असा इशारा देतो की, हीच तर्कसंगती AI ला लागू केल्यास "ज्या सर्जनशीलतेचे रक्षण करण्यासाठी कॉपीराइट कायदा बनवला गेला आहे, तिलाच तो खिळखिळा करेल."

AI डेव्हलपर्स आणि कंटेंट क्रिएटर्ससाठी असलेले परिणाम

  • नवनिर्मितीचा धोका: प्रशिक्षणासाठी वापरल्या जाणाऱ्या प्रत्येक मजकुरासाठी परवाना (license) आवश्यक असल्यास खर्च इतका वाढू शकतो की, अत्याधुनिक मॉडेल्स तयार करणे आर्थिकदृष्ट्या अशक्य होईल.
  • सर्जनशील कार्यप्रवाह: मानवी लेखक मसुदा तयार करणे, संपादन करणे आणि विचारमंथन करण्यासाठी अधिकाधिक LLMs वर अवलंबून आहेत. जर प्रशिक्षण प्रक्रिया बेकायदेशीर ठरवली गेली, तर ती साधने गायब होऊ शकतात, ज्यामुळे विविध उद्योगांमध्ये मजकूर निर्मितीची पद्धत बदलू शकते.
  • बाजारावर परिणाम: वृत्तपत्र उद्योग असा युक्तिवाद करतो की, प्रश्नांची उत्तरे देऊ शकणारी किंवा बातम्यांसारखा मजकूर तयार करू शकणारी AI मॉडेल्स मूळ रिपोर्टिंगचे मूल्य कमी करतात, ज्यामुळे जाहिरात महसूल आणि सबस्क्रिप्शनमध्ये घट होऊ शकते.

कॉपीराइट ऑफिसचा प्रतिवाद

माजी रजिस्ट्रार शिरा पर्लमटर यांच्या नेतृत्वाखाली तयार करण्यात आलेल्या अमेरिकन कॉपीराइट ऑफिसच्या अलीकडील अहवालाने 'फेअर-युज' (fair-use) च्या सर्वसमावेशक बचावाचा विरोध केला आहे. या कार्यालयाने AI ला मानवी शिकण्यापासून वेगळे करणारे तीन घटक अधोरेखित केले आहेत: कॉपी केलेल्या साहित्याचे प्रचंड प्रमाण, ज्या वेगाने त्यावर प्रक्रिया केली जाते आणि परिणामी मॉडेल्स व्यावसायिक उत्पादने म्हणून विकली जाऊ शकतात, जी थेट मूळ निर्मात्यांशी स्पर्धा करतात.

DOJ या मुद्द्यांचे खंडन करते आणि नमूद करते की, या अहवालाला कोणतेही बंधनकारक कायदेशीर अधिकार नाहीत आणि विद्यमान कायदेशीर प्रकरणांमध्ये आधीच 'फेअर-युज'चे तथ्यनिहाय विश्लेषण आवश्यक असते. विभाग असा इशारा देतो की, "व्यापक दायित्व" लादल्यास उद्योगाला अशा परवाना पद्धतीमध्ये ढकलले जाईल जी "प्रगत AI मॉडेल्सचा विकास कायदेशीर आणि आर्थिकदृष्ट्या अशक्य करेल."

पुढे काय होऊ शकते

'टाइम्स' प्रकरणाची सुनावणी घेणाऱ्या जिल्हा न्यायालयाला DOJ ची 'फेअर-युज'ची भूमिका आणि कॉपीराइट ऑफिसचे निष्कर्ष यांचा विचार करावा लागेल. जर निकाल DOJ च्या बाजूने लागला, तर तो एक नमुना (precedent) ठरेल की, जोपर्यंत मॉडेलचे आउटपुट 'महत्त्वपूर्ण साम्यापासून' दूर आहे, तोपर्यंत स्पष्ट परवानगीशिवाय प्रशिक्षण डेटा संकलित केला जाऊ शकतो. वृत्तपत्रांच्या बाजूने निर्णय आल्यास परवाना करारांच्या वाटाघाटींची लाट येऊ शकते, ज्यामुळे AI संशोधनाचे अर्थशास्त्र बदलू शकते.

थोडक्यात

DOJ चा अर्ज 'AI प्रशिक्षण हे फेअर-युज आहे की नाही' या प्रश्नाला एका मोठ्या जोखमीच्या न्यायालयीन लढाईत बदलतो. याचा निकाल हे ठरवेल की डेव्हलपर्स सध्याच्या मजकुरावर शक्तिशाली लँग्वेज मॉडेल्स तयार करणे सुरू ठेवू शकतात की त्यांना प्रत्येक सामग्रीसाठी महागडे परवाने घ्यावे लागतील. या निर्णयाचा परिणाम टेक क्षेत्र, मीडिया उद्योग आणि व्यापक सर्जनशील अर्थव्यवस्थेवर होईल.