सर्जनशील समुदाय आता केवळ मूकदर्शक बनून राहिलेला नाही, कारण त्यांच्या आयुष्यभराच्या कष्टाचे काम मोठ्या प्रशिक्षण डेटासेटमध्ये (training datasets) समाविष्ट केले जात आहे. प्रसिद्ध लेखक ते डिजिटल चित्रकार (digital illustrators) पर्यंत, वाढत्या कायदेशीर कारवाईच्या लाटेमुळे AI क्षेत्रातील दिग्गज कंपन्यांनी बौद्धिक संपदेच्या (intellectual property) अनधिकृत स्क्रॅपिंगला (scraping) समर्थन देण्यासाठी वापरत असलेल्या "fair use" बचावावर आव्हान दिले जात आहे.
अनधिकृत प्रशिक्षण संचांचा शोध
निर्माते (creators) आणि AI डेव्हलपर्समधील तणाव The Atlantic च्या अहवालांनंतर टोकाला पोहोचला, ज्यांनी लार्ज लँग्वेज मॉडेल्सना (large language models) प्रशिक्षित करण्यासाठी वापरल्या गेलेल्या कामांचा तपशील देणारा शोधण्यायोग्य डेटासेट प्रसिद्ध केला. कर्क वॉलेस जॉन्सन (Kirk Wallace Johnson) सारख्या लेखकांसाठी, हा शोध वैयक्तिक आणि खोलवर परिणाम करणारा होता. The Feather Thief आणि The Fishermen and the Dragon सारख्या सखोल संशोधनावर आधारित नॉन-फिक्शन (nonfiction) कामांसाठी ओळखल्या जाणाऱ्या जॉन्सन यांना असे आढळले की, त्यांची अनेक वर्षांची कष्टपूर्ण तपास आणि लेखन, संमती किंवा मोबदल्याशिवाय पायरेट (pirated) करून चॅटबॉट्समध्ये (chatbots) वापरले गेले आहे.
ही घटना केवळ एक विलग घटना नसून एक पद्धतशीर प्रक्रिया आहे. सर्जनशील व्यावसायिक आता हे शोधत आहेत की त्यांची मालकीची कामे—जी अनेकदा वर्षांच्या कष्टाचा परिणाम असतात—त्यांचा वापर "अत्यंत श्रीमंत" (galactically wealthy) कॉर्पोरेशन उभारण्यासाठी केला जात आहे. या वास्तव्यामुळे केवळ चिंतेकडून आता सक्रिय कायदेशीर लढाईकडे (litigation) कल वाढला आहे, कारण कलाकार त्यांच्या बौद्धिक संपदेवर पुन्हा नियंत्रण मिळवण्याचा प्रयत्न करत आहेत.
धोरणात्मक कायदेशीर लढा: टेक दिग्गजांना लक्ष्य करणे
ही कायदेशीर मोहीम बहुआयामी आहे, ज्यामध्ये जनरेटिव्ह AI मॉडेल्स (generative AI models) तयार करण्याच्या मूळ कार्यपद्धतीला लक्ष्य केले जात आहे. कलाकार केवळ कॉपीराइट उल्लंघनाच्या (copyright infringement) दाव्यांवर अवलंबून नाहीत; ते कंपन्यांना जबाबदार धरण्यासाठी 'सेवा अटींच्या' (terms of service) उल्लंघनासारख्या मार्गांचाही शोध घेत आहेत.
अनेक हाय-प्रोफाईल कायदेशीर लढाया आधीच सुरू आहेत. अनेक निर्मात्यांनी Susman Godfrey सारख्या विशेष कायदेशीर संघांशी हातमिळवणी केली आहे, जे सध्या विविध लेखकांच्या वतीने Anthropic विरुद्ध महत्त्वपूर्ण खटला लढत आहेत. या चळवळीतील इतर अग्रदूतंमध्ये चित्रकार आणि कार्टूनिस्ट सारा अँडरसन (Sarah Andersen) यांचा समावेश आहे, ज्यांनी AI दिग्गजांना थेट आव्हान देणाऱ्या पहिल्या व्यक्तींपैकी एक म्हणून ओळख निर्माण केली. या खटल्यांचा उद्देश उद्योगाची मोबदल्याशिवाय डेटा स्क्रॅपिंगवर असलेली अवलंबित्व संपवणे आणि प्रशिक्षण संच (training sets) कशा प्रकारे तयार केले जावेत यासाठी एक नवीन मानक प्रस्थापित करणे हा आहे.
"Fair Use" चे रणमैदान
या न्यायालयांमधील मुख्य संघर्ष "fair use" च्या कायदेशीर व्याख्येमध्ये आहे. AI कंपन्यांचा असा युक्तिवाद आहे की अस्तित्वात असलेल्या डेटावर मॉडेल प्रशिक्षित करणे हे 'रूपांतरित' (transformative) आहे आणि ते कायदेशीर संरक्षणाखाली येते. तथापि, निर्मात्यांचे म्हणणे आहे की जेव्हा एखादे AI एखाद्या कलाकाराची विशिष्ट शैली किंवा लेखकाचा अद्वितीय आवाज हुबेहूब उतरवू शकते, तेव्हा ते 'रूपांतरित' राहत नाही, तर ते मूळ कामाचे मूल्य कमी करणारे थेट बाजारपेठेतील पर्याय (market substitute) बनते.
जसे हे खटले पुढे जातील, तसे ते AI क्षेत्राचे भविष्य ठरवतील. या निकालांवरून हे स्पष्ट होईल की "AI slop"—म्हणजेच कमी दर्जाच्या, अनुकरणीय मजकुराचे (derivative content) मोठ्या प्रमाणावर उत्पादन—कायदेशीररित्या टिकवून ठेवता येईल की माहिती अर्थव्यवस्थेच्या (information economy) केंद्रस्थानी असलेल्या मानवी निर्मात्यांचे संरक्षण करण्यासाठी परवानाधारक आणि नैतिक डेटा संपादन (ethical data acquisition) यांचा एक नवीन काळ सुरू होईल.
मुख्य निष्कर्ष
- पद्धतशीर डेटा स्क्रॅपिंग: प्रमुख AI मॉडेल्स निर्मात्यांच्या संमतीशिवाय सखोल संशोधने असलेली पुस्तके आणि मालकीची कलाकृती असलेले पायरेटेड डेटासेट वापरत असल्याचे आढळले आहे.
- विविध कायदेशीर रणनीती: कॉपीराइट उल्लंघन, सेवा अटींचे उल्लंघन आणि "fair use" सिद्धांताला आव्हान देऊन AI कंपन्यांना लक्ष्य केले जात आहे.
- बौद्धिक संपदेसाठी (IP) निर्णायक क्षण: Anthropic सारख्या कंपन्यांविरुद्ध सुरू असलेल्या खटल्यांचे निकाल जनरेटिव्ह AI च्या युगात बौद्धिक संपदेचे मूल्य कसे ठरवले जाईल, यासाठी कायदेशीर आदर्श (precedent) प्रस्थापित करतील.
वाद कसा भडकला
जेव्हा एका मोठ्या मासिकाने लार्ज लँग्वेज मॉडेल्सना प्रशिक्षित करण्यासाठी वापरल्या गेलेल्या पुस्तकांची, लेखांची आणि कलाकृतींची शोधण्यायोग्य यादी प्रसिद्ध केली, तेव्हा या वादाची ठिणगी पडली. लेखक कर्क वॉलेस जॉन्सन यांच्यासाठी, ज्यांच्या नॉन-फिक्शन पुस्तकांसाठी अनेक वर्षे संशोधन आणि प्रवास करावा लागला होता, हा खुलासा वैयक्तिक होता. त्यांना असे आढळले की, ज्या शब्दांना परिपूर्ण करण्यासाठी त्यांनी एक दशक खर्च केला होता, तेच शब्द चॅटबॉट्सच्या डेटाचा भाग होते, जे कोणत्याही रॉयल्टी किंवा श्रेयशिवाय (acknowledgement) त्यांच्या शैलीची मागणी केल्यावर पुनरुत्पादन करू शकतात.
जॉन्सन् यांचा अनुभव ही केवळ एक विलग घटना नाही. साहित्य, चित्रण, संगीत आणि चित्रपट क्षेत्रातील निर्माते असे सांगत आहेत की त्यांच्या कॉपीराइट असलेल्या उत्पादनांची मोठ्या प्रमाणावर चोरी (harvested) केली गेली आहे. ही पद्धत, जिला उद्योगातील तज्ज्ञ "पायरेटेड डेटासेट" काढण्याची पद्धत म्हणून वर्णन करतात, तिने चिंतेचे रूपांतर समन्वित कायदेशीर कारवाईत केले आहे. कलाकार आता असा युक्तिवाद करत आहेत की त्यांनी निर्माण केलेले मूल्य "अत्यंत श्रीमंत" टेक महामंडळांकडे वळवले जात आहे, जे त्यांच्या कष्टाचा नफा कमावतात, तर निर्मात्यांना काहीही मिळत नाही.
लढाईला आकार देणारे खटले
हा कायदेशीर हल्ला जनरेटिव्ह एआय मॉडेल्स तयार करण्याच्या मूळ प्रक्रियेवर लक्ष केंद्रित करतो. वादी केवळ कॉपीराइट उल्लंघनासाठीच नाही, तर प्लॅटफॉर्मच्या स्वतःच्या सेवा अटींच्या (terms of service) उल्लंघनासाठी देखील दावे दाखल करत आहेत. इलस्ट्रेटर आणि कार्टूनिस्ट सारा अँडरसन, ज्यांचे काम इंटरनेट संस्कृतीचा अविभाज्य भाग बनले आहे, त्या एआय कंपनीविरुद्ध थेट खटला दाखल करणाऱ्या पहिल्या दृश्य कलाकारांपैकी एक होत्या. त्यांच्या दाव्यानुसार, मॉडेलची त्यांची वैशिष्ट्यपूर्ण रेखाचित्रे आणि विनोद शैलीची नक्कल करण्याची क्षमता त्यांच्या मूळ कॉमिक्सच्या बाजारपेठेचे नुकसान करते, ज्यामुळे त्यांचे ब्रँड प्रभावीपणे सर्वांसाठी मोफत उपलब्ध असलेल्या संसाधनात रूपांतरित होतात.
या प्रकरणांची हाताळणी बौद्धिक संपदा विवादातील तज्ज्ञ आणि तंत्रज्ञान क्षेत्रातील दिग्गज कंपन्यांना आव्हान देण्याचा अनुभव असलेल्या वकिलांकडून केली जात आहे. वापरलेले नेमके डेटासेट शोधून काढणे, कंपन्यांना विवादित सामग्रीचा वापर थांबवण्यास भाग पाडणे आणि चोरी केलेल्या सामग्रीच्या व्यावसायिक मूल्याला अनुसरून नुकसान भरपाई मिळवणे, ही त्यांची रणनीती आहे.
“फेअर युज” (वाजवी वापर) युक्तिवादावर टीका
एआय डेव्हलपर्सचे असे म्हणणे आहे की, सार्वजनिकरित्या उपलब्ध असलेल्या डेटावर मॉडेल प्रशिक्षित करणे हा एक 'रूपांतरित वापर' (transformative use) आहे, ज्याला कायदा संरक्षण देतो. त्यांचा असा युक्तिवाद आहे की, मॉडेल कोणत्याही एका कामाची हुबेहूब नक्कल करत नाही; त्याऐवजी, ते असे नमुने (patterns) शिकते ज्यामुळे ते नवीन मजकूर किंवा चित्रे तयार करू शकते. त्या दृष्टिकोनातून, ही प्रक्रिया एखाद्या संशोधकाने ज्ञान मिळवण्यासाठी अनेक पुस्तके वाचण्यासारखी आहे, ती पुस्तकांची नक्कल करण्यासारखी नाही.
निर्मात्यांचा असा प्रतिवाद आहे की, जेव्हा आउटपुट हे लेखकाचा आवाज किंवा कलाकाराची शैली यांची जवळजवळ हुबेहूब नक्कल असू शकते, तेव्हा 'रूपांतरण' ही केवळ एक कमकुवत सबब ठरते. जेव्हा चॅटबॉट एखाद्या कादंबरीकाराच्या वैशिष्ट्यपूर्ण लयीत आणि शब्दरचनेत प्रश्नांची उत्तरे देऊ शकतो, किंवा जेव्हा इमेज-जनरेटर एखाद्या जिवंत इलस्ट्रेटरच्या पोर्टफोलिओप्रमाणेच चित्रे तयार करू शकतो, तेव्हा त्याचा परिणाम बाजारातील पर्यायासारखा होतो. वादींचा असा युक्तिवाद आहे की, या पर्यायामुळे त्यांची पुस्तके, कमिशन आणि परवाना करार (licensing deals) विकण्याची क्षमता बाधित होते आणि व्यावसायिक प्रभावामुळे "फेअर युज"चा बचाव कोलमडतो.
काय धोक्यात आहे
एआय कंपन्यांवर आर्थिक दबाव – जर न्यायालयाने असा निर्णय दिला की मोठ्या प्रमाणावर केलेले स्क्रॅपिंग कॉपीराइटचे उल्लंघन आहे, तर कंपन्यांना मोठ्या आर्थिक परिणामांना सामोरे जावे लागू शकते, ज्यामुळे त्यांच्या डेटा पाइपलाइनमध्ये बदल करण्यास भाग पडू शकते.
न्यायालयीन कागदपत्रे आणि तथ्य शोधणे (discovery) – कागदपत्रांच्या पुढील लाटेमुळे नेमकी कोणती शीर्षके आणि चित्रे वापरली गेली होती हे स्पष्ट होईल, ज्यामुळे डेटा संकलनाच्या (data harvesting) व्याप्तीचे अधिक स्पष्ट चित्र समोर येईल.
