NYT ने बड़े कॉपीराइट मुकदमे में OpenAI पर सबूत छिपाने का आरोप लगाया
The New York Times और OpenAI के बीच चल रही कानूनी लड़ाई ने एक नाटकीय मोड़ ले लिया है, जिसमें आरोप लगाया गया है कि AI दिग्गज ने अपने ट्रेनिंग डेटासेट के संबंध में जानबूझकर सबूतों को छिपाया है। यह घटनाक्रम मुकदमे के केंद्र को कॉपीराइट उल्लंघन से हटाकर न्यायिक खोज (discovery) प्रक्रिया की अखंडता की ओर स्थानांतरित करने का खतरा पैदा करता है।
भ्रामक डेटा प्रथाओं के आरोप
The New York Times और The Daily News का दावा है कि OpenAI अपने ट्रेनिंग कॉर्पस (corpus) और ग्राहकों के चैट लॉग्स, दोनों को खोजने की अपनी तकनीकी क्षमता के संबंध में असत्य रहा है। दो साल की इस मुकदमेबाजी के दौरान, OpenAI का तर्क रहा है कि उसके विशाल डेटासेट को खोजना तकनीकी रूप से बोझिल होगा और इससे उपयोगकर्ता की गोपनीयता से समझौता होगा।
हालांकि, OpenAI के डेटा गोपनीयता इंजीनियर विनी मोनाको (Vinnie Monaco) के हालिया बयान (deposition) ने इस विमर्श को चुनौती दी है। आरोप है कि मोनाको ने खुलासा किया कि OpenAI ने विशेष रूप से कॉपीराइट वाले पत्रकारिता कार्यों की पहचान करने के लिए अपने ट्रेनिंग कॉर्पस की आंतरिक खोज पहले ही कर ली थी। इसके अलावा, बयान से संकेत मिलता है कि OpenAI ने संभावित कॉपीराइट उल्लंघन की सीमा का आंतरिक रूप से आकलन करने के लिए लगभग 78 मिलियन डी-आइडेंटिफाइड (de-identified) ChatGPT बातचीत का एक डेटाबेस एकत्र किया था।
Project Giraffe और "Bloom" फ़िल्टर
शायद सबसे महत्वपूर्ण तकनीकी खुलासा "Project Giraffe" से संबंधित है, जो OpenAI द्वारा लागू किए गए उपकरणों का एक सेट है। वादियों (plaintiffs) के अनुसार, मुकदमा दायर होने के कुछ ही समय बाद, OpenAI ने "regurgitation" (पुनरुत्पादन) के मामलों का पता लगाने और उन्हें रिकॉर्ड करने के लिए इस प्रोजेक्ट के हिस्से के रूप में "Bloom" फ़िल्टर का उपयोग किया था—जहाँ मॉडल अपने आउटपुट में कॉपीराइट वाली सामग्री को शब्दशः (verbatim) दोहराता है।
Project Giraffe का अस्तित्व OpenAI के उस पिछले रुख का खंडन करता है जिसमें कहा गया था कि उसके लॉग्स के भीतर सामग्री पुनरुत्पादन के विशिष्ट मामलों की पहचान करना एक कठिन कार्य था। वादियों का तर्क है कि ये उपकरण साबित करते हैं कि OpenAI न केवल कॉपीराइट उल्लंघन की निगरानी करने में सक्षम था, बल्कि सक्रिय रूप से इसे ट्रैक करने के लिए बुनियादी ढांचा (infrastructure) भी तैयार कर रहा था।
डेटा अखंडता और खोज (Discovery) पर विवाद
यह संघर्ष अदालत को प्रदान किए गए डेटा की गुणवत्ता पर भी केंद्रित रहा है। जबकि वादियों ने मूल रूप से 120 मिलियन चैट लॉग्स के नमूने का अनुरोध किया था, OpenAI ने इस संख्या को घटाकर 20 मिलियन कर दिया। जब दिसंबर में नमूना अंततः जमा किया गया, तो कथित तौर पर अत्यधिक रेडैक्शन (redactions) के कारण अदालत ने इसे "अनुपयोगी" पाया।
NYT ने इससे भी आगे बढ़ते हुए आरोप लगाया है कि OpenAI ने अदालत के आदेशानुसार संरक्षण आदेश (preservation order) का उल्लंघन करते हुए अरबों ChatGPT आउटपुट को डिलीट कर दिया और दिए गए नमूने में लाखों लॉग्स को बदल दिया। इसके जवाब में, OpenAI के प्रवक्ता ड्रू पुसेतरी (Drew Pusateri) ने सभी आरोपों से इनकार किया है और टाइम्स पर आरोप लगाया है कि जैसे-जैसे उनका कानूनी मामला कमजोर हो रहा है, वे उपयोगकर्ता की गोपनीयता में घुसपैठ करने का प्रयास कर रहे हैं।
यह AI उद्योग के लिए क्यों महत्वपूर्ण है
यह मामला जनरेटिव AI विकास के भविष्य और "fair use" की कानूनी सीमाओं के लिए एक संकेतक (bellwether) है। यदि अदालत पाती है कि OpenAI ने सबूत छिपाए या खोज प्रक्रिया (discovery) में हेरफेर किया, तो यह एक मिसाल कायम कर सकता है कि AI कंपनियों को अपनी ट्रेनिंग कार्यप्रणाली और डेटा वंशावली (data lineage) का खुलासा कैसे करना होगा। डेवलपर्स और AI संस्थापकों के लिए, इसका परिणाम विशाल डेटा अंतर्ग्रहण (data ingestion) और बौद्धिक संपदा अधिकारों के संगम पर आवश्यक पारदर्शिता के स्तर को स्पष्ट करेगा।
मुख्य बातें
- आंतरिक निगरानी उपकरण: आरोपों से संकेत मिलता है कि OpenAI ने कॉपीराइट वाली सामग्री के पुनरुत्पादन (regurgitation) को सक्रिय रूप से ट्रैक करने के लिए "Project Giraffe" और "Bloom" फ़िल्टर का उपयोग किया था।
- विरोधाभासी गवाही: बयान (deposition) के साक्ष्य बताते हैं कि OpenAI के पास अपने ट्रेनिंग डेटा को खोजने की तकनीकी क्षमता थी, जो तकनीकी बोझ के उसके पिछले दावों का खंडन करती है।
- खोज (Discovery) की अखंडता दांव पर: मुकदमा अब इस बात पर टिका है कि क्या OpenAI ने आउटपुट को डिलीट करके और "अनुपयोगी" रेडैक्टेड डेटा नमूने प्रदान करके संरक्षण आदेशों का उल्लंघन किया है।
