কেন মামলাটি আদালতে পৌঁছাল
২০২৪ সালের আগস্ট এবং সেপ্টেম্বর মাসে প্রকাশিত এএনআই (ANI)-এর নিজস্ব নিবন্ধগুলোর সাথে চ্যাটজিপিটি (ChatGPT)-র সাম্প্রতিক ভারতীয় খবরের উত্তরগুলোর মিল লক্ষ্য করার পর সংস্থাটি মামলা করে। সংস্থাটির দাবি ছিল যে, লার্জ ল্যাঙ্গুয়েজ মডেলটি তাদের কপিরাইটযুক্ত টেক্সট বা লেখা পুনরায় ব্যবহার করছে। এই দাবি যদি বহাল থাকে, তবে ওপেনএআই (OpenAI)-কে ভারতে তাদের মডেলগুলোর ব্যবহার বন্ধ করতে বা ব্যাপকভাবে সীমাবদ্ধ করতে হতে পারে।
ওপেনএআই (OpenAI) জবাবে জানায় যে, উল্লিখিত দুটি মডেল—GPT-4 এবং নতুন GPT-4o—এপ্রিল ২০২২ এবং এপ্রিল ২০২৪-এর কাট-অফ ডেট বা নির্দিষ্ট সময়সীমার আগের ডেটার ওপর ভিত্তি করে প্রশিক্ষিত। এএনআই (ANI)-এর নিবন্ধগুলো সেই তারিখগুলোর পরে প্রকাশিত হয়েছে, তাই সেগুলো মূল ট্রেনিং সেটে থাকার কথা নয়। বিচারক অমিত বনসাল বলেন, এই মিল সম্ভবত Retrieval-Augmented Generation (RAG) থেকে এসেছে, যা রিয়েল-টাইমে ওয়েব থেকে বর্তমান কন্টেন্ট সংগ্রহ করে উত্তর দেয়, মডেলের নিবন্ধগুলো "মনে রাখা" থেকে নয়।
আইনি মোড়: প্রশিক্ষণ হিসেবে "গবেষণা"
এই মামলাটি গুরুত্বপূর্ণ কারণ আদালত ভারতের কপিরাইট আইনের "গবেষণা সহ ব্যক্তিগত বা নিজস্ব ব্যবহারের" ব্যতিক্রমী নিয়মটিকে বিস্তৃতভাবে ব্যাখ্যা করেছে। উভয় পক্ষই একমত হয়েছিল যে ওপেনএআই (OpenAI) প্রাথমিক প্রশিক্ষণের সময় এএনআই (ANI)-এর উপকরণ ব্যবহার করেছিল, তবে বিচারক সেই ব্যবহারকে "রূপান্তরমূলক" (transformative) হিসেবে গণ্য করেছেন। অন্য কথায়, মডেলটি কেবল ব্যাকরণ, সিনট্যাক্স এবং পরিসংখ্যানগত প্যাটার্নগুলো গ্রহণ করেছে, কিন্তু মূল ভাব বা প্রকাশ্য বিষয়বস্তুকে অপরিবর্তিত রেখেছে।
আদালত দুটি কঠোর শর্ত আরোপ করেছে:
- প্রশিক্ষণের জন্য ব্যবহৃত কপিগুলো অবশ্যই বৈধ উৎস থেকে আসতে হবে, পাইরেটেড আর্কাইভ বা এমন পেওয়াল (paywall) থেকে নয় যা ব্যবহারকারী অ্যাক্সেস করতে পারেন না।
- উপকরণগুলো ডেভেলপারের নিজস্ব পরিবেশের মধ্যেই থাকতে হবে; এগুলো প্রকাশ বা বিতরণ করা যাবে না।
একটি তিন-স্তরীয় ন্যায্যতা পরীক্ষা (fairness test) প্রয়োগ করে, বিচারক দেখতে পান যে ওপেনএআই (OpenAI)-এর ব্যবহার কেবল প্রশিক্ষণের মধ্যেই সীমাবদ্ধ ছিল, মডেলটি হুবহু কোনো অনুচ্ছেদ মুখস্থ করেছে এমন কোনো প্রমাণ পাওয়া যায়নি এবং তিনি উল্লেখ করেন যে এএনআই (ANI)-এর কোনো সরাসরি অর্থনৈতিক ক্ষতি হয়নি কারণ উভয় প্রতিষ্ঠান ভিন্ন ভিন্ন বাজার segment-এ কাজ করে।
বৈশ্বিক রায়ের প্রেক্ষাপটে এর অবস্থান
ভারতের এই অবস্থান এখন বেশ কিছু মার্কিন মামলার অনুরূপ, যা এআই (AI) আউটপুটের একটি রূপান্তরমূলক দৃষ্টিভঙ্গিকে সমর্থন করে। Kadrey v. Meta মামলায় আদালত রায় দিয়েছিল যে, জেনারেট করা টেক্সট যদি হুবহু শব্দ কপি না করে, তবে তা কপিরাইট লঙ্ঘন নয়; অন্যদিকে দীর্ঘদিনের Google Books সিদ্ধান্তটি ডিজিটাইজেশন প্রকল্পের জন্য একটি সীমিত "search-and-display" ব্যতিক্রমকে স্বীকৃতি দিয়েছিল। অন্যান্য মার্কিন মামলা, যেমন Raw Story মামলাটি ক্ষতির প্রমাণ না পাওয়ায় খারিজ হয়ে গিয়েছিল, তবে Anthropic বিতর্ক বিচারকদের মনে করিয়ে দিয়েছে যে পাইরেটেড ডেটা ব্যবহার করা এখনও দায়বদ্ধতা তৈরি করতে পারে।
ইউরোপজুড়ে এ বিষয়ে মতভেদ প্রকট। মিউনিখের আদালত রায় দিয়েছে যে মডেল ওয়েটসের (model weights) মধ্যে থাকা গানের কথা (lyrics) পুনরুৎপাদন করা কপিরাইট লঙ্ঘন; অন্যদিকে লন্ডনের একটি ট্রাইব্যুনাল সম্প্রতি একই কারণে Stability AI-এর বিরুদ্ধে করা একটি দাবি খারিজ করে দিয়েছে। দিল্লি হাইকোর্টের এই রায়টি আরও একটি তথ্য যোগ করল: যদি প্রশিক্ষণ বৈধ উৎসের মধ্যে সীমাবদ্ধ থাকে এবং আউটপুট হুবহু কপি না হয়, তবে সেই কার্যক্রমটি গবেষণার ব্যতিক্রম হিসেবে গণ্য হতে পারে।
ডেভেলপারদের যা খেয়াল রাখা উচিত
- RAG বনাম প্রশিক্ষণ – "মুখস্থ করা" (প্রশিক্ষণ) এবং রিয়েল-টাইম রিট্রিভাল (RAG)-এর মধ্যে আদালতের এই পার্থক্য নির্দেশ করে যে, ভবিষ্যতের বিতর্কগুলো এই বিষয়টির ওপর কেন্দ্র করে হবে যে একটি উত্তর কি একটি স্থির জ্ঞানভাণ্ডার (static knowledge base) থেকে আসছে নাকি সরাসরি ওয়েব থেকে আনা হচ্ছে। ডেভেলপারদের তাদের প্রোডাক্ট ডকুমেন্টেশনে এই পার্থক্যটি আরও স্পষ্ট করার প্রয়োজন হতে পারে।
- উৎস বা প্রোভেন্যান্স (Source provenance) – "বৈধ উৎস"-এর প্রয়োজনীয়তা কোম্পানিগুলোকে তাদের ডেটা-কিউরেশন পাইপলাইন আরও কঠোর করতে বাধ্য করতে পারে, যেখানে চুক্তি বা লাইসেন্সের মাধ্যমে প্রমাণ করতে হবে যে প্রতিটি টেক্সট অংশ বৈধ।
- শুধুমাত্র অভ্যন্তরীণ ব্যবহার – যেসব কোম্পানি মডেলের আউটপুট বাণিজ্যিকীকরণ করার পরিকল্পনা করছে, তাদের অবশ্যই প্রশিক্ষণ ডেটা কঠোরভাবে অভ্যন্তরীণ রাখতে হবে। পার্টনার বা জনসাধারণের সাথে র (raw) কর্পোরা (corpora) শেয়ার করলে গবেষণার প্রতিরক্ষা যুক্তিটি দুর্বল হয়ে যেতে পারে।
- অর্থনৈতিক ক্ষতির পরীক্ষা – যেহেতু আদালত সরাসরি আর্থিক ক্ষতির অনুপস্থিতির ওপর জোর দিয়েছে, তাই দাবিদারদের কেবল ব্র্যান্ডের ভাবমূর্তি ক্ষুণ্ণ হওয়ার ধারণা নয়, বরং প্রকৃত ক্ষতির প্রমাণ দেখাতে হবে।
- আইন প্রণয়নকারী প্রতিক্রিয়া – ভারতীয় আইনপ্রণেতারা এআই (AI) সংক্রান্ত কপিরাইট বিতর্কগুলো পর্যবেক্ষণ করছেন। গবেষণার ব্যতিক্রমী নিয়মটিকে সংকুচিত করে এমন কোনো সংশোধনী ইতিমধ্যে মোতায়েন করা মডেলগুলোকে ভূতাপেক্ষভাবে (retroactively) প্রভাবিত করতে পারে, যা কমপ্লায়েন্স অডিটের একটি ঢেউ ঘটাতে পারে।
পাল্টা যুক্তি যা এখনও এআই-কে তাড়া করে
এএনআই (ANI)-এর অভিযোগ একটি প্রকৃত উদ্বেগকে সামনে এনেছে: যেহেতু এলএলএম (LLM)-গুলো নির্দিষ্ট শব্দ বা বাক্যাংশ অনুকরণ করতে আরও দক্ষ হয়ে উঠছে, তাই "রূপান্তরমূলক" ব্যবহার এবং "কপি" বা নকল করার মধ্যকার সীমারেখা অস্পষ্ট হয়ে যেতে পারে। সমালোচকরা যুক্তি দেন যে, RAG প্রযুক্তিগতভাবে একটি সার্চ ফাংশন হলেও, এটি অনুমতি ছাড়াই কপিরাইটযুক্ত কন্টেন্ট সামনে নিয়ে আসে, যা সম্ভাব্যভাবে "জনসাধারণের কাছে যোগাযোগ করার" (communication to the public) অধিকার লঙ্ঘন করতে পারে।
একটি নজির যার বিশ্বব্যাপী প্রভাব রয়েছে
মডেল ট্রেনিংকে একটি অনুমোদিত গবেষণা কার্যক্রম হিসেবে শ্রেণীবদ্ধ করার মাধ্যমে, দিল্লি হাইকোর্ট ইঙ্গিত দিয়েছে যে ভারত কপিরাইট বা মেধাস্বত্ব আইনের ভিত্তিতে লার্জ ল্যাঙ্গুয়েজ মডেলের বিকাশকে স্বয়ংক্রিয়ভাবে বাধা দেবে না, যদি ডেভেলপাররা উৎসের বৈধতা মেনে চলেন এবং ট্রেনিং প্রক্রিয়া অভ্যন্তরীণ রাখেন। এই ব্যাখ্যা কোম্পানিগুলোকে ভারতে তাদের কার্যক্রম সম্প্রসারণে উৎসাহিত করতে পারে, কারণ তারা জানবে যে একটি প্রধান আইনি বাধা কিছুটা শিথিল হয়েছে।
অন্যান্য দেশের নিয়ন্ত্রক সংস্থাগুলোর জন্য এই রায়টি একটি মডেল প্রদান করে: একটি সংকীর্ণ ও সুপ্রমাণিত গবেষণার ব্যতিক্রম (research exception) সংজ্ঞায়িত করা, উৎসের ক্ষেত্রে স্পষ্ট মানদণ্ড আরোপ করা এবং ট্রেনিং ডেটা শুধুমাত্র অভ্যন্তরীণভাবে ব্যবহারের শর্ত রাখা। যেসব দেশ এই ধরনের নীতিমালা গ্রহণ করবে, তারা তাদের দেশীয় এআই (AI) ইকোসিস্টেমকে বিনিয়োগ আকর্ষণের জন্য প্রয়োজনীয় নিশ্চয়তা দিতে পারবে।
মূল কথা: দিল্লি হাইকোর্টের এই সিদ্ধান্ত এআই ট্রেনিংয়ের জন্য যেকোনো টেক্সট স্ক্র্যাপ করার অবাধ স্বাধীনতা দেয় না, তবে এটি প্রতিষ্ঠিত করে যে ভারতীয় আইনের অধীনে, সুশৃঙ্খল এবং আইনসম্মত ট্রেনিং গবেষণার অন্তর্ভুক্ত। এই ব্যাখ্যাটি বিশ্বজুড়ে আদালতগুলোর জন্য একটি রেফারেন্স পয়েন্ট হয়ে উঠতে পারে, কারণ তারা এখন এই জটিলতা নিয়ে কাজ করছে যে—মেশিনকে ভাষা বুঝতে শেখানো একটি সুরক্ষিত পাণ্ডিত্যপূর্ণ কার্যক্রম নাকি এটি একটি সম্ভাব্য কপিরাইট লঙ্ঘন।
