मोठ्या कॉपीराइट खटल्यात NYT ने OpenAI वर पुरावे लपवल्याचा आरोप केला
The New York Times आणि OpenAI यांच्यातील सुरू असलेल्या कायदेशीर लढाईने नाट्यमय वळण घेतले आहे, कारण AI क्षेत्रातील या दिग्गज कंपनीने आपल्या ट्रेनिंग डेटासेटबाबतचे पुरावे जाणीवपूर्वक लपवल्याचा आरोप करण्यात आला आहे. या वाढत्या तणावामुळे, या खटल्याचे लक्ष कॉपीराइट उल्लंघनाकडून न्यायालयीन शोध प्रक्रियेच्या (judicial discovery process) अखंडतेकडे वळण्याची शक्यता आहे.
दिशाभूल करणाऱ्या डेटा पद्धतींचे आरोप
The New York Times आणि The Daily News यांचा दावा आहे की, OpenAI ने आपल्या ट्रेनिंग कॉर्पस (training corpus) आणि ग्राहकांच्या चॅट लॉग्स शोधण्याच्या तांत्रिक क्षमतेबाबत असत्य माहिती दिली आहे. गेल्या दोन वर्षांच्या या कायदेशीर लढाईत, OpenAI ने असा दावा कायम ठेवला आहे की, त्यांच्या अवाढव्य डेटासेटमध्ये शोध घेणे तांत्रिकदृष्ट्या कठीण असेल आणि यामुळे वापरकर्त्यांच्या गोपनीयतेचा भंग होईल.
तथापि, OpenAI चे डेटा प्रायव्हसी इंजिनिअर विनी मोनॅको (Vinnie Monaco) यांच्या अलीकडील साक्षीत (deposition) या दाव्याला आव्हान देण्यात आले आहे. मोनॅको यांनी कथितरित्या उघड केले की, कॉपीराइट असलेल्या पत्रकारिता कार्यांची ओळख पटवण्यासाठी OpenAI ने आधीच त्यांच्या ट्रेनिंग कॉर्पसमध्ये अंतर्गत शोध घेतला होता. शिवाय, या साक्षीत असे सुचवण्यात आले आहे की, संभाव्य कॉपीराइट उल्लंघनाची व्याप्ती अंतर्गत तपासण्यासाठी OpenAI ने सुमारे ७ कोटी ८० लाख (78 million) 'डी-आयडेंटिफाईड' (de-identified) ChatGPT संभाषणांचा डेटाबेस तयार केला होता.
Project Giraffe आणि "Bloom" फिल्टर
कदाचित सर्वात महत्त्वाचा तांत्रिक खुलासा "Project Giraffe" शी संबंधित आहे, जे OpenAI ने कार्यान्वित केलेले साधनांचे एक संच आहे. फिर्यादींच्या म्हणण्यानुसार, खटला दाखल झाल्यानंतर काही काळानंतरच, OpenAI ने "regurgitation" (जेव्हा मॉडेल कॉपीराइट असलेले साहित्य जसेच्या तसे आउटपुटमध्ये देते) च्या घटना शोधण्यासाठी आणि नोंदवण्यासाठी या प्रकल्पाचा भाग म्हणून "Bloom" फिल्टरचा वापर केला होता.
Project Giraffe चे अस्तित्व OpenAI च्या त्या पूर्वीच्या भूमिकेला छेद देते, ज्यामध्ये त्यांनी म्हटले होते की त्यांच्या लॉग्समध्ये मजकूर पुनरुत्पादनाच्या विशिष्ट घटना ओळखणे हे अशक्य काम आहे. फिर्यादींचा असा युक्तिवाद आहे की, ही साधने हे सिद्ध करतात की OpenAI केवळ कॉपीराइट उल्लंघनवर लक्ष ठेवण्यास सक्षमच नव्हते, तर ते त्याचा मागोवा घेण्यासाठी सक्रियपणे पायाभूत सुविधा (infrastructure) देखील तयार करत होते.
डेटा अखंडता आणि शोध प्रक्रियेबाबत वाद
हा संघर्ष न्यायालयाला पुरवल्या जाणाऱ्या डेटाच्या गुणवत्तेवरही केंद्रित झाला आहे. फिर्यादींनी मूळतः १२० दशलक्ष चॅट लॉग्सचा नमुना मागितला होता, परंतु OpenAI ने तो आकडा कमी करून २० दशलक्ष केला. जेव्हा डिसेंबरमध्ये हा नमुना सादर करण्यात आला, तेव्हा अतिप्रमाणात माहिती लपवल्यामुळे (redactions) तो "वापरण्यायोग्य नाही" असे न्यायालयाने म्हटले आहे.
NYT ने तर इतके पुढे जाऊन आरोप केला आहे की, OpenAI ने न्यायालयाच्या 'प्रिझर्वेशन ऑर्डर'चे (माहिती जतन करण्याचा आदेश) उल्लंघन करून अब्जावधी ChatGPT आउटपुट्स डिलीट केले आणि पुरवलेल्या नमुन्यात लाखो लॉग्स बदलले. प्रत्युत्तरादाखल, OpenAI चे प्रवक्ते ड्रेयस पुसेटेरी (Drew Pusateri) यांनी सर्व आरोप फेटाळून लावले असून, त्यांचा कायदेशीर खटला कमकुवत होत असताना टाइम्स वापरकर्त्यांच्या गोपनीयतेवर आक्रमण करण्याचा प्रयत्न करत असल्याचा आरोप केला आहे.
AI उद्योगासाठी हे का महत्त्वाचे आहे
हा खटला जनरेटिव्ह AI विकास आणि "फेअर युज" (fair use) च्या कायदेशीर मर्यादांच्या भविष्यासाठी एक सूचक (bellwether) ठरेल. जर न्यायालयाने असे आढळले की OpenAI ने पुरावे लपवले किंवा शोध प्रक्रियेत फेरफार केला, तर AI कंपन्यांनी त्यांच्या ट्रेनिंग पद्धती आणि डेटाचा उगम (data lineage) कसा उघड करणे आवश्यक आहे, यासाठी हे एक उदाहरण ठरू शकते. डेव्हलपर्स आणि AI संस्थापकांसाठी, प्रचंड डेटाचा वापर आणि बौद्धिक संपदा अधिकार (intellectual property rights) यांच्यातील संबंधांमध्ये पारदर्शकता किती असावी, हे या निकालामुळे स्पष्ट होईल.
मुख्य मुद्दे
- अंतर्गत देखरेख साधने: आरोपांनुसार, OpenAI ने कॉपीराइट असलेल्या मजकुराचे पुनरुत्पादन (regurgitation) सक्रियपणे ट्रॅक करण्यासाठी "Project Giraffe" आणि "Bloom" फिल्टरचा वापर केला.
- विरोधाभासी साक्ष: साक्षीतून असे दिसून येते की OpenAI कडे त्यांच्या ट्रेनिंग डेटाचा शोध घेण्याची तांत्रिक क्षमता होती, जे त्यांच्या तांत्रिक अडचणीच्या पूर्वीच्या दाव्यांच्या विरोधात आहे.
- शोध प्रक्रियेच्या अखंडतेचा प्रश्न: हा खटला आता यावर अवलंबून आहे की, OpenAI ने आउटपुट्स डिलीट करून आणि "वापरण्यायोग्य नसलेले" माहिती लपवलेले डेटा सॅम्पल्स देऊन 'प्रिझर्व्हेशन ऑर्डर'चे उल्लंघन केले आहे का.
