বড় কপিরাইট মামলায় তথ্য গোপন করার অভিযোগে OpenAI-এর বিরুদ্ধে NYT-এর অভিযোগ

The New York Times এবং OpenAI-এর মধ্যে চলমান আইনি লড়াইয়ে এক নাটকীয় মোড় এসেছে, যেখানে অভিযোগ করা হয়েছে যে এই AI জায়ান্টটি ইচ্ছাকৃতভাবে তার ট্রেনিং ডেটাসেট সংক্রান্ত তথ্য গোপন করেছে। এই উত্তেজনা মামলার কেন্দ্রবিন্দুকে কপিরাইট লঙ্ঘনের বিষয় থেকে সরিয়ে বিচার বিভাগীয় ডিসকভারি (discovery) প্রক্রিয়ার সততা বা স্বচ্ছতার দিকে নিয়ে যাওয়ার ঝুঁকি তৈরি করেছে।

প্রতারণামূলক ডেটা ব্যবহারের অভিযোগ

The New York Times এবং The Daily News দাবি করেছে যে, OpenAI তাদের ট্রেনিং কর্পাস (training corpus) এবং গ্রাহকদের চ্যাট লগ উভয়ই অনুসন্ধান করার প্রযুক্তিগত সক্ষমতা সম্পর্কে অসত্য তথ্য প্রদান করেছে। দুই বছর ধরে চলা এই মামলা চলাকালীন, OpenAI দাবি করে আসছে যে তাদের বিশাল ডেটাসেট অনুসন্ধান করা প্রযুক্তিগতভাবে অত্যন্ত কষ্টসাধ্য এবং এটি ব্যবহারকারীর গোপনীয়তা ক্ষুণ্ণ করতে পারে।

তবে, OpenAI-এর ডেটা প্রাইভেসি ইঞ্জিনিয়ার Vinnie Monaco-এর সাম্প্রতিক একটি জবানবন্দি (deposition) এই দাবিকে চ্যালেঞ্জ করেছে। Monaco নাকি প্রকাশ করেছেন যে, কপিরাইটযুক্ত সাংবাদিকতামূলক কাজগুলো শনাক্ত করার জন্য OpenAI ইতিমধ্যেই তাদের ট্রেনিং কর্পাসে অভ্যন্তরীণ অনুসন্ধান চালিয়েছিল। তদুপরি, জবানবন্দিতে ইঙ্গিত দেওয়া হয়েছে যে, সম্ভাব্য কপিরাইট লঙ্ঘনের মাত্রা অভ্যন্তরীণভাবে মূল্যায়ন করার জন্য OpenAI প্রায় 78 মিলিয়ন ডি-আইডেন্টিফাইড (de-identified) ChatGPT কথোপকথনের একটি ডেটাবেস তৈরি করেছিল।

Project Giraffe এবং "Bloom" ফিল্টার

সম্ভবত সবচেয়ে উল্লেখযোগ্য প্রযুক্তিগত প্রকাশটি হলো "Project Giraffe", যা OpenAI দ্বারা বাস্তবায়িত একগুচ্ছ টুল। বাদীদের (plaintiffs) মতে, মামলাটি দায়ের করার কিছুকাল পরেই OpenAI এই প্রকল্পের অংশ হিসেবে একটি "Bloom" ফিল্টার ব্যবহার করেছিল যাতে "regurgitation" বা তথ্য পুনরাবৃত্তি শনাক্ত ও রেকর্ড করা যায়—যেখানে মডেলটি তার আউটপুটে কপিরাইটযুক্ত বিষয়বস্তু হুবহু প্রকাশ করে দেয়।

Project Giraffe-এর অস্তিত্ব OpenAI-এর পূর্ববর্তী অবস্থানের সাথে সাংঘর্ষিক, যেখানে তারা দাবি করেছিল যে তাদের লগ থেকে বিষয়বস্তু পুনরুৎপাদনের নির্দিষ্ট ঘটনাগুলো শনাক্ত করা একটি অসম্ভব কাজ। বাদীরা যুক্তি দিচ্ছেন যে, এই টুলগুলো প্রমাণ করে যে OpenAI কেবল কপিরাইট লঙ্ঘন পর্যবেক্ষণ করার ক্ষমাই রাখত না, বরং এটি ট্র্যাক করার জন্য সক্রিয়ভাবে অবকাঠামো তৈরি করছিল।

ডেটার সততা এবং ডিসকভারি নিয়ে বিতর্ক

এই দ্বন্দ্বটি আদালতে প্রদান করা ডেটার গুণমানের ওপরও কেন্দ্র করে আবর্তিত হয়েছে। যদিও বাদীরা মূলত ১২০ মিলিয়ন চ্যাট লগের একটি নমুনা অনুরোধ করেছিলেন, OpenAI সেই সংখ্যাটি কমিয়ে ২০ মিলিয়নে নিয়ে আসে। যখন অবশেষে ডিসেম্বরে নমুনাটি জমা দেওয়া হয়, তখন অতিরিক্ত তথ্য মুছে ফেলার (redactions) কারণে আদালত এটিকে "অব্যবহারযোগ্য" বলে অভিহিত করেছে বলে জানা গেছে।

NYT আরও এক ধাপ এগিয়ে অভিযোগ করেছে যে, OpenAI আদালতের নির্দেশিত সংরক্ষণ আদেশ (preservation order) লঙ্ঘন করে বিলিয়ন বিলিয়ন ChatGPT আউটপুট মুছে ফেলেছে এবং প্রদান করা নমুনায় লক্ষ লক্ষ লগ পরিবর্তন করেছে। এর প্রতিক্রিয়ায়, OpenAI-এর মুখপাত্র Drew Pusateri সমস্ত অভিযোগ অস্বীকার করেছেন এবং অভিযোগ করেছেন যে, তাদের আইনি মামলা দুর্বল হয়ে পড়ায় Times ব্যবহারকারীর গোপনীয়তা লঙ্ঘনের চেষ্টা করছে।

কেন এটি AI শিল্পের জন্য গুরুত্বপূর্ণ

এই মামলাটি জেনারেটিভ AI উন্নয়ন এবং "fair use" বা ন্যায্য ব্যবহারের আইনি সীমানার ভবিষ্যতের জন্য একটি নির্দেশক (bellwether) হিসেবে কাজ করবে। আদালত যদি দেখতে পায় যে OpenAI তথ্য গোপন করেছে বা ডিসকভারি প্রক্রিয়াকে প্রভাবিত করেছে, তবে এটি AI কোম্পানিগুলোর তাদের ট্রেনিং পদ্ধতি এবং ডেটা উৎস (data lineage) প্রকাশ করার ক্ষেত্রে একটি নজির স্থাপন করতে পারে। ডেভেলপার এবং AI প্রতিষ্ঠাতাদের জন্য, এই মামলার ফলাফল বিশাল ডেটা সংগ্রহ এবং মেধাস্বত্ব অধিকারের সন্ধিক্ষণে কতটুকু স্বচ্ছতা প্রয়োজন তা স্পষ্ট করবে।

মূল বিষয়সমূহ

  • অভ্যন্তরীণ মনিটরিং টুল: অভিযোগ অনুযায়ী, OpenAI কপিরাইটযুক্ত বিষয়বস্তুর পুনরাবৃত্তি সক্রিয়ভাবে ট্র্যাক করার জন্য "Project Giraffe" এবং একটি "Bloom" ফিল্টার ব্যবহার করেছিল।
  • পরস্পরবিরোধী সাক্ষ্য: জবানবন্দির প্রমাণ ইঙ্গিত দেয় যে OpenAI-এর তাদের ট্রেনিং ডেটা অনুসন্ধান করার প্রযুক্তিগত ক্ষমতা ছিল, যা তাদের পূর্ববর্তী প্রযুক্তিগত জটিলতার দাবির সাথে সাংঘর্ষিক।
  • ডিসকভারির সততা ঝুঁকির মুখে: মামলাটি এখন এই বিষয়ের ওপর নির্ভর করছে যে, OpenAI আউটপুট মুছে ফেলে এবং "অব্যবহারযোগ্য" তথ্য মুছে ফেলা ডেটা নমুনা প্রদান করে সংরক্ষণ আদেশ লঙ্ঘন করেছে কি না।