रचनात्मक समुदाय अब मूकदर्शक बनकर नहीं देख रहा है कि उनके जीवन भर की मेहनत को विशाल प्रशिक्षण डेटासेट में समाहित किया जा रहा है। प्रशंसित लेखकों से लेकर डिजिटल चित्रकारों तक, कानूनी कार्रवाई की एक बढ़ती लहर उन एआई दिग्गजों द्वारा उपयोग किए जाने वाले "fair use" (उचित उपयोग) के बचाव को चुनौती दे रही है, जो बौद्धिक संपदा की अनधिकृत स्क्रैपिंग को सही ठहराने के लिए इसका उपयोग करते हैं।

अनधिकृत प्रशिक्षण सेटों की खोज

रचनाकारों और एआई डेवलपर्स के बीच तनाव The Atlantic की रिपोर्टों के बाद चरम पर पहुँच गया, जिसने बड़े भाषा मॉडल (large language models) को प्रशिक्षित करने के लिए उपयोग किए गए कार्यों का विवरण देने वाला एक खोजने योग्य डेटासेट प्रकाशित किया। किर्क वॉलेस जॉनसन जैसे लेखकों के लिए, यह खोज व्यक्तिगत और गहरी थी। जॉनसन, जो The Feather Thief और The Fishermen and the Dragon जैसे गहन शोध वाले गैर-काल्पनिक कार्यों के लिए जाने जाते हैं, ने पाया कि वर्षों की कठिन जांच और लेखन को उनकी सहमति या मुआवजे के बिना पायरेट कर चैटबॉट्स में डाल दिया गया था।

यह घटना कोई अलग-थलग मामला नहीं है बल्कि एक व्यवस्थित अभ्यास है। रचनात्मक पेशेवर यह पता लगा रहे हैं कि उनके मालिकाना काम—जो अक्सर वर्षों की मेहनत का परिणाम होते हैं—"अत्यधिक समृद्ध" निगमों के निर्माण के लिए उपयोग किए जा रहे हैं। इस अहसास ने केवल चिंता से सक्रिय मुकदमेबाजी की ओर रुख कर दिया है, क्योंकि कलाकार अपनी बौद्धिक संपदा पर नियंत्रण वापस पाने की कोशिश कर रहे हैं।

रणनीतिक मुकदमेबाजी: टेक दिग्गजों को निशाना बनाना

कानूनी हमला बहुआयामी है, जो जनरेटिव एआई मॉडल बनाने की मूल कार्यप्रणाली को निशाना बनाता है। कलाकार केवल कॉपीराइट उल्लंघन के दावों पर निर्भर नहीं हैं; वे कंपनियों को जवाबदेह ठहराने के लिए सेवा की शर्तों (terms of service) के उल्लंघन जैसे रास्तों की भी तलाश कर रहे हैं।

हाई-प्रोफाइल कानूनी लड़ाइयाँ पहले से ही चल रही हैं। कई रचनाकारों ने Susman Godfrey जैसी विशेष कानूनी टीमों के साथ हाथ मिलाया है, जो वर्तमान में विभिन्न लेखकों की ओर से Anthropic के खिलाफ एक महत्वपूर्ण मामले का नेतृत्व कर रही है। इस आंदोलन के अन्य अग्रदूतों में चित्रकार और कार्टूनिस्ट सारा एंडरसन शामिल हैं, जो सीधे एआई दिग्गजों को चुनौती देने वालों में से पहली थीं। इन मुकदमों का उद्देश्य अनपेक्षित डेटा स्क्रैपिंग पर उद्योग की निर्भरता को खत्म करना और प्रशिक्षण सेटों को क्यूरेट करने के तरीके के लिए एक नया मानक स्थापित करना है।

"Fair Use" का युद्धक्षेत्र

इन अदालतों में केंद्रीय तनाव "fair use" की कानूनी परिभाषा में निहित है। एआई कंपनियां तर्क देती हैं कि मौजूदा डेटा पर मॉडल को प्रशिक्षित करना परिवर्तनकारी (transformative) है और कानूनी सुरक्षा के अंतर्गत आता है। हालांकि, रचनाकारों का तर्क है कि जब एक एआई किसी कलाकार की विशिष्ट शैली या किसी लेखक की अनूठी आवाज की नकल कर सकता है, तो यह परिवर्तनकारी नहीं रह जाता और एक प्रत्यक्ष बाजार प्रतिस्थापन (market substitute) बन जाता है जो मूल कार्य के मूल्य को कम कर देता है।

जैसे-जैसे ये मामले आगे बढ़ेंगे, वे एआई परिदृश्य के भविष्य को परिभाषित करेंगे। परिणाम यह निर्धारित करेंगे कि "AI slop"—निम्न गुणवत्ता वाली, व्युत्पन्न सामग्री का बड़े पैमाने पर उत्पादन—का वर्तमान प्रक्षेपवक्र कानूनी रूप से टिकाऊ है, या सूचना अर्थव्यवस्था के केंद्र में मानव रचनाकारों की रक्षा के लिए लाइसेंस प्राप्त, नैतिक डेटा अधिग्रहण का एक नया युग उभरना चाहिए।

मुख्य बातें

  • व्यवस्थित डेटा स्क्रैपिंग: प्रमुख एआई मॉडल रचनाकारों की सहमति के बिना गहन शोध वाली पुस्तकों और मालिकाना कलाकृतियों वाले पायरेटेड डेटासेट का उपयोग करते पाए गए हैं।
  • विविध कानूनी रणनीतियाँ: मुकदमे कॉपीराइट उल्लंघन, सेवा की शर्तों के उल्लंघन और "fair use" सिद्धांत को चुनौती देते हुए एआई कंपनियों को निशाना बना रहे हैं।
  • IP के लिए एक महत्वपूर्ण क्षण: Anthropic जैसी कंपनियों के खिलाफ चल रहे मामलों के परिणाम यह तय करेंगे कि जनरेटिव एआई के युग में बौद्धिक संपदा का मूल्य कैसे निर्धारित किया जाएगा।

विवाद कैसे भड़का

इसकी शुरुआत तब हुई जब एक प्रमुख पत्रिका ने उन पुस्तकों, लेखों और कलाकृतियों की एक खोजने योग्य सूची प्रकाशित की, जिन पर बड़े भाषा मॉडल को प्रशिक्षित किया गया था। लेखक किर्क वॉलेस जॉनसन के लिए, जिनकी गैर-काल्पनिक पुस्तकों में वर्षों के शोध और यात्रा की आवश्यकता होती है, यह खुलासा व्यक्तिगत था। उन्होंने पाया कि जिन शब्दों को उन्होंने एक दशक तक निखारने में बिताया था, वे उस डेटा का हिस्सा थे जो उन चैटबॉट्स को शक्ति प्रदान करते हैं जो बिना किसी रॉयल्टी या पावती के उनकी मांग पर उनकी शैली को पुनरुत्पादित कर सकते हैं।

जॉनसन का अनुभव कोई अकेला मामला नहीं है। साहित्य, चित्रण, संगीत और फिल्म के रचनाकार रिपोर्ट कर रहे हैं कि उनके कॉपीराइट वाली सामग्री को बड़े पैमाने पर एकत्र किया गया है। यह अभ्यास, जिसे उद्योग के भीतर के लोग "पायरेटेड डेटासेट" के व्यवस्थित निष्कर्षण के रूप में वर्णित करते हैं, ने चिंता को समन्वित कानूनी कार्रवाई में बदल दिया है। कलाकार अब तर्क देते हैं कि उनके द्वारा बनाया गया मूल्य उन "अत्यधिक समृद्ध" तकनीकी समूहों में स्थानांतरित किया जा रहा है जो उनके श्रम से लाभ कमाते हैं जबकि रचनाकारों को कुछ भी नहीं मिलता।

वे मुकदमे जो इस लड़ाई को आकार दे रहे हैं

यह कानूनी हमला इस बात के मूल पर केंद्रित है कि जनरेटिव एआई मॉडल कैसे बनाए जाते हैं। वादी न केवल कॉपीराइट उल्लंघन के लिए, बल्कि प्लेटफॉर्म की अपनी सेवा की शर्तों के उल्लंघन के लिए भी दावे दायर कर रहे हैं। इलस्ट्रेटर और कार्टूनिस्ट सारा एंडरसन, जिनका काम इंटरनेट संस्कृति का एक अभिन्न हिस्सा बन गया है, एआई कंपनी के खिलाफ सीधा मुकदमा करने वाले पहले दृश्य कलाकारों में से एक थीं। उनकी याचिका में तर्क दिया गया है कि मॉडल की उनके विशिष्ट रेखांकन (line work) और हास्य की नकल करने की क्षमता उनके मूल कॉमिक्स के बाजार को नुकसान पहुँचाती है, जिससे प्रभावी रूप से उनका ब्रांड एक मुफ्त संसाधन में बदल जाता है।

इन मामलों को उन वकीलों द्वारा संभाला जा रहा है जो बौद्धिक संपदा विवादों में विशेषज्ञ हैं और जिनका टेक दिग्गजों को चुनौती देने का ट्रैक रिकॉर्ड रहा है। उनकी रणनीति उपयोग किए गए सटीक डेटासेट का खुलासा करने के लिए मजबूर करना, कंपनियों को विवादित सामग्री का उपयोग रोकने के लिए बाध्य करना और चोरी की गई सामग्री के व्यावसायिक मूल्य को दर्शाने वाले हर्जाने की मांग करना है।

'फेयर यूज़' (उचित उपयोग) के तर्क पर सवाल

एआई डेवलपर्स का तर्क है कि सार्वजनिक रूप से उपलब्ध डेटा पर मॉडल को प्रशिक्षित करना एक परिवर्तनकारी उपयोग है जिसे कानून संरक्षण प्रदान करता है। उनका तर्क है कि मॉडल किसी भी एकल कार्य को शब्दशः पुनरुत्पादित नहीं करता है; इसके बजाय, यह उन पैटर्न को सीखता है जो इसे नया टेक्स्ट या इमेज बनाने में सक्षम बनाते हैं। उस दृष्टिकोण से, यह प्रक्रिया किसी शोधकर्ता द्वारा जानकारी प्राप्त करने के लिए कई किताबें पढ़ने के समान है, न कि उन्हें कॉपी करने के।

रचनाकार इसका मुकाबला करते हुए कहते हैं कि जब आउटपुट किसी लेखक की आवाज़ या कलाकार की शैली की लगभग समान प्रतिलिपि हो सकता है, तो 'परिवर्तन' केवल एक कमजोर बहाना है। जब एक चैटबॉट किसी उपन्यासकार की प्रसिद्ध लय और शब्दावली के साथ किसी प्रश्न का उत्तर दे सकता है, या जब एक इमेज-जेनरेटर ऐसी तस्वीरें बना सकता है जिन्हें किसी जीवित इलस्ट्रेटर के पोर्टफोलियो से अलग करना मुश्किल हो, तो परिणाम बाजार के विकल्प के रूप में कार्य करता है। वादी तर्क देते हैं कि यह प्रतिस्थापन उनकी किताबें, कमीशन और लाइसेंसिंग सौदे बेचने की क्षमता को नुकसान पहुँचाता है, और 'फेयर यूज़' का बचाव व्यावसायिक प्रभाव के बोझ तले ढह जाता है।

क्या दांव पर है

  • एआई फर्मों पर आर्थिक दबाव – यदि अदालतें यह फैसला सुनाती हैं कि बड़े पैमाने पर स्क्रैपिंग कॉपीराइट का उल्लंघन करती है, तो कंपनियों को महत्वपूर्ण वित्तीय परिणामों का सामना करना पड़ सकता है, जिससे संभावित रूप से डेटा पाइपलाइनों में बदलाव आ सकता है।

  • अदालती फाइलिंग और डिस्कवरी – दस्तावेजों की अगली लहर यह स्पष्ट करेगी कि वास्तव में किन शीर्षकों और छवियों का उपयोग किया गया था, जिससे डेटा हार्वेस्टिंग के पैमाने की स्पष्ट तस्वीर मिलेगी।