NYT نے بڑے کاپی رائٹ ٹرائل میں OpenAI پر شواہد چھپانے کا الزام لگا دیا

The New York Times اور OpenAI کے درمیان جاری قانونی جنگ نے ایک ڈرامائی موڑ اختیار کر لیا ہے، جس میں یہ الزامات لگائے گئے ہیں کہ AI کے اس بڑے ادارے نے جان بوجھ کر اپنے ٹریننگ ڈیٹا سیٹس کے حوالے سے شواہد کو چھپایا۔ اس کشیدگی سے یہ خطرہ پیدا ہو گیا ہے کہ مقدمے کا مرکز کاپی رائٹ کی خلاف ورزی سے ہٹ کر عدالتی دریافت (discovery) کے عمل کی شفافیت پر منتقل ہو سکتا ہے۔

ڈیٹا کے دھوکہ دہی پر مبنی طریقوں کے الزامات

The New York Times اور The Daily News کا دعویٰ ہے کہ OpenAI اپنے ٹریننگ کارپسس (corpus) اور صارفین کے چیٹ لاگز، دونوں کو تلاش کرنے کی تکنیکی صلاحیت کے حوالے سے غیر سچا رہا ہے۔ دو سالہ قانونی کارروائی کے دوران، OpenAI کا موقف رہا ہے کہ اپنے وسیع ڈیٹا سیٹس کو تلاش کرنا تکنیکی طور پر بوجھل ہوگا اور اس سے صارفین کی رازداری متاثر ہوگی۔

تاہم، OpenAI کے ڈیٹا پرائیویسی انجینئر Vinnie Monaco کے حالیہ بیان (deposition) نے اس بیانیے کو چیلنج کیا ہے۔ مبینہ طور پر Monaco نے انکشاف کیا ہے کہ OpenAI نے خاص طور پر کاپی رائٹ شدہ صحافتی کاموں کی شناخت کے لیے اپنے ٹریننگ کارپسس میں پہلے ہی اندرونی تلاش کر لی تھی۔ مزید برآں، بیان سے یہ اشارہ ملتا ہے کہ OpenAI نے ممکنہ کاپی رائٹ کی خلاف ورزی کی حد کا اندرونی طور پر جائزہ لینے کے لیے تقریباً 78 ملین غیر شناخت شدہ (de-identified) ChatGPT گفتگو کا ایک ڈیٹا بیس جمع کیا تھا۔

Project Giraffe اور "Bloom" فلٹر

شاید سب سے اہم تکنیکی انکشاف "Project Giraffe" سے متعلق ہے، جو OpenAI کے ذریعے نافذ کردہ ٹولز کا ایک مجموعہ ہے۔ مدعیین کے مطابق، مقدمہ دائر ہونے کے فوراً بعد، OpenAI نے اس پروجیکٹ کے حصے کے طور پر "regurgitation" (دوبارہ پیش کرنے) کے واقعات کا پتہ لگانے اور انہیں ریکارڈ کرنے کے لیے "Bloom" فلٹر کا استعمال کیا—جہاں ماڈل اپنے نتائج میں کاپی رائٹ شدہ مواد کو لفظ بہ لفظ دوبارہ پیش کرتا ہے۔

Project Giraffe کا وجود OpenAI کے اس سابقہ موقف کی نفی کرتا ہے کہ اس کے لاگز کے اندر مواد کی دوبارہ پیشی کے مخصوص واقعات کی شناخت کرنا ایک ناممکن کام تھا۔ مدعیین کا استدلال ہے کہ یہ ٹولز ثابت کرتے ہیں کہ OpenAI نہ صرف کاپی رائٹ کی خلاف ورزی کی نگرانی کرنے کے قابل تھا بلکہ وہ اس کا پیچھا کرنے کے لیے فعال طور پر انفراسٹرکچر بھی تیار کر رہا تھا۔

ڈیٹا کی سالمیت اور دریافت (Discovery) پر تنازعات

یہ تنازع عدالت کو فراہم کردہ ڈیٹا کے معیار پر بھی مرکوز رہا ہے۔ اگرچہ مدعیین نے اصل میں 120 ملین چیٹ لاگز کے نمونے کی درخواست کی تھی، لیکن OpenAI نے اس تعداد کو کم کروا کر 20 ملین کر دیا۔ جب دسمبر میں نمونہ آخر کار جمع کرایا گیا، تو رپورٹ کے مطابق عدالت نے ضرورت سے زیادہ معلومات حذف (redactions) کیے جانے کی وجہ سے اسے "ناقابل استعمال" پایا۔

NYT نے مزید یہ الزام بھی لگایا ہے کہ OpenAI نے عدالت کے حکم کے تحت ڈیٹا محفوظ رکھنے کے حکم کی خلاف ورزی کرتے ہوئے ChatGPT کے اربوں نتائج کو حذف کر دیا اور فراہم کردہ نمونے میں لاکھوں لاگز کو تبدیل کر دیا۔ جواب میں، OpenAI کے ترجمان Drew Pusateri نے تمام الزامات کی تردید کرتے ہوئے Times پر الزام لگایا ہے کہ جیسے جیسے ان کا قانونی کیس کمزور ہو رہا ہے، وہ صارفین کی رازداری میں مداخلت کرنے کی کوشش کر رہے ہیں۔

یہ AI کی صنعت کے لیے کیوں اہم ہے

یہ کیس جنریٹیو AI کی ترقی اور "fair use" (منصفانہ استعمال) کی قانونی حدود کے مستقبل کے لیے ایک اہم اشارہ ہے۔ اگر عدالت یہ پاتی ہے کہ OpenAI نے شواہد چھپائے یا دریافت کے عمل میں ہیرا پھیری کی، تو یہ اس بات کے لیے ایک مثال قائم کر سکتا ہے کہ AI کمپنیوں کے لیے اپنی ٹریننگ کے طریقوں اور ڈیٹا کے ذرائع (data lineage) کو ظاہر کرنا کتنا ضروری ہے۔ ڈویلپرز اور AI بانیوں کے لیے، اس کا نتیجہ اس شفافیت کی سطح کو واضح کرے گا جو بڑے پیمانے پر ڈیٹا کے استعمال اور دانشورانہ ملکیت کے حقوق کے سنگم پر ضرورت ہوگی۔

اہم نکات

  • اندرونی نگرانی کے ٹولز: الزامات سے پتہ چلتا ہے کہ OpenAI نے کاپی رائٹ شدہ مواد کی دوبارہ پیشی (regurgitation) پر فعال طور پر نظر رکھنے کے لیے "Project Giraffe" اور "Bloom" فلٹر کا استعمال کیا۔
  • متضاد گواہی: بیان کے شواہد سے پتہ چلتا ہے کہ OpenAI کے پاس اپنے ٹریننگ ڈیٹا کو تلاش کرنے کی تکنیکی صلاحیت موجود تھی، جو کہ اس کے تکنیکی بوجھ کے سابقہ دعووں کے برعکس ہے۔
  • دریافت (Discovery) کی سالمیت داؤ پر: مقدمہ اب اس بات پر منحصر ہے کہ آیا OpenAI نے نتائج کو حذف کر کے اور "ناقابل استعمال" نظر آنے والے حذف شدہ ڈیٹا کے نمونے فراہم کر کے ڈیٹا محفوظ رکھنے کے احکامات کی خلاف ورزی کی تھی۔