সত্য নাদেলা সম্প্রতি সেইসব ল্যাবগুলোর সাথে প্রকাশ্য যুদ্ধে জড়িয়েছেন যাদের গড়ে তুলতে তার কোম্পানি সাহায্য করেছিল। মাইক্রোসফ্টের প্রধান নির্বাহী একটি কঠোর সতর্কবার্তা দিয়েছেন যে কীভাবে বড় বড় এআই (AI) কোম্পানিগুলো ডেটা মালিকানার নিয়মগুলো নতুন করে লিখছে, এবং এই বার্তাটি অস্বাভাবিক প্রভাব ফেলেছে। একটি সাম্প্রতিক ব্লগ পোস্টে, নাদেলা OpenAI এবং Anthropic-সহ ফ্রন্টিয়ার ল্যাবগুলোর বিরুদ্ধে একটি কারসাজি বাজার (rigged marketplace) তৈরি করার অভিযোগ এনেছেন। তারা বিশাল মডেল প্রশিক্ষণের জন্য পাবলিক ডেটা সংগ্রহ করে, এবং তারপর তাদের পরিষেবার শর্তাবলী (terms of service) এমনভাবে প্রয়োগ করে যাতে কেউ সেই মডেলগুলোর আউটপুট থেকে শিখতে না পারে। তার যুক্তি অনুযায়ী, এর ফলে মূল্যের একটি একতরফা হস্তান্তর ঘটে, যেখানে এন্টারপ্রাইজগুলো বিল পরিশোধ করার পাশাপাশি তাদের নিজস্ব বা মালিকানাধীন জ্ঞানও হারিয়ে ফেলছে।
ডিস্টিলেশন বা পাতন প্রক্রিয়ার দ্বিমুখী নীতি
এই অভিযোগটি বুঝতে হলে সেই কৌশলটি দেখা প্রয়োজন যা এই ল্যাবগুলো বাধা দিতে এত আগ্রহী। ডিস্টিলেশন (Distillation) হলো একটি সাধারণ প্রশিক্ষণ পদ্ধতি যেখানে একটি ছোট, বিশেষায়িত মডেল শুরু থেকে ইন্টারনেট থেকে কাঁচা টেক্সট গ্রহণ করার পরিবর্তে একটি বড় মডেলের আউটপুট থেকে শেখে। একটি স্টার্টআপ বা গবেষণা দল একটি ফ্রন্টিয়ার মডেলকে লক্ষ লক্ষ প্রম্পট দিতে পারে, সেই রেসপন্সগুলো সংগ্রহ করতে পারে এবং সেই সমৃদ্ধ সংকেত (signal) ব্যবহার করে একটি কম্প্যাক্ট মডেল প্রশিক্ষণ দিতে পারে যা লোকালি চলে বা কোনো নির্দিষ্ট প্রয়োজন মেটায়। এটি একদম শুরু থেকে একটি ফাউন্ডেশন মডেল তৈরির চেয়ে অনেক সস্তা এবং অনেক কম শক্তি সাপেক্ষ।
OpenAI এবং Anthropic উভয়ই তাদের পরিষেবার শর্তাবলীতে এই পদ্ধতিটি নিষিদ্ধ করেছে। যখন তারা পদ্ধতিগত ডিস্টিলেশন শনাক্ত করে, তখন তারা এটিকে নিয়ম লঙ্ঘন হিসেবে গণ্য করে। এই নিয়ম প্রয়োগের লক্ষ্য প্রায়ই প্রতিদ্বন্দ্বীরা হয়, বিশেষ করে চীনের এআই কোম্পানিগুলো, যাদের বিরুদ্ধে অভিযোগ যে তারা মূল প্রশিক্ষণে ব্যয় করা কোটি কোটি ডলারের সমপরিমাণ খরচ না করেই এই পদ্ধতি ব্যবহার করে সক্ষমতার ব্যবধান কমিয়ে আনছে।
নাদেলা এই নীতির মূলে থাকা টানাপোড়েনের বিষয়টি তুলে ধরেছেন। এই ল্যাবগুলোই তাদের ফ্ল্যাগশিপ মডেলগুলো তৈরি করেছে ওপেন ওয়েব ক্রল করে, বই, ফোরাম, কোড রিপোজিটরি এবং নিবন্ধ স্ক্র্যাপ করে; আর এর পেছনে আইনি যুক্তি ছিল যে পাবলিকলি অ্যাক্সেসযোগ্য ডেটার ওপর প্রশিক্ষণ দেওয়া 'ফেয়ার ইউজ' (fair use) বা ন্যায্য ব্যবহারের অন্তর্ভুক্ত। তারা সাধারণ সম্পদ (commons) থেকে তথ্য আহরণ করেছে। অথচ এখন তারা আইনি বেষ্টনী তৈরি করছে যাতে কেউ বিনিময়ে তাদের মডেলের আউটপুটকে পাবলিক শিক্ষণ উপকরণ হিসেবে ব্যবহার করতে না পারে। তারা যেন বলতে চায়, "আপনি বিশ্বের উন্মুক্ত জ্ঞান থেকে শিখতে পারেন, কিন্তু আমাদের থেকে কেউ শিখতে পারবে না।"
এই অসামঞ্জস্যতা কেবল তাত্ত্বিক বিতর্কের মধ্যেই সীমাবদ্ধ নয়। এটি এমন একটি শ্রেণিবিন্যাস তৈরি করে যেখানে মুষ্টিমেয় কিছু ইনফ্রাস্ট্রাকচার প্রোভাইডার নিয়ন্ত্রণ করে কে কী জানতে পারবে। যদি 'ফেয়ার ইউজ' মানবতার প্রকাশিত বুদ্ধিমত্তা ব্যবহারের ন্যায্যতা দেয়, তবে সেই মডেলগুলোর আউটপুট একটি ব্যক্তিগতকৃত সাধারণ সম্পদে (privatized commons) পরিণত হতে শুরু করে। প্রতিযোগীরা এবং গ্রাহকরা একইভাবে সেই সংকেতকে নতুন টুলে রূপান্তর করতে বাধা পায়। ফলে সব পথ কেবল বড় ল্যাবগুলোর দিকেই ধাবিত হয়।
নিজের বুদ্ধিমত্তার জন্য দুবার মূল্য দেওয়া
নাদেলা এই অর্থনৈতিক ফাঁদটির জন্য একটি শব্দ ব্যবহার করেছেন: "রিভার্স ইনফরমেশন প্যারাডক্স" (reverse information paradox)। তার মতে, এন্টারপ্রাইজগুলো বর্তমানে কৃত্রিম বুদ্ধিমত্তার জন্য দুইবার মূল্য দিচ্ছে, কিন্তু তার মধ্যে কেবল একটি পেমেন্ট ইনভয়েসে দেখা যায়।
প্রথম খরচটি স্পষ্ট। কোম্পানিগুলো API ক্রেডিট কেনে, Copilot-এর সাবস্ক্রিপশন নেয় অথবা চ্যাটবট পরিষেবার লাইসেন্স নেয়। দ্বিতীয় খরচটি লুকানো। প্রতিবার যখন একজন কর্মচারী কোনো ভুল তথ্য (hallucinated fact) সংশোধন করেন, কোনো রেসপন্সকে সহায়ক হিসেবে রেটিং দেন বা একটি জেনারেটেড রিপোর্ট পরিমার্জন করেন, তখন সেই কাজটি এমন কিছু তৈরি করে যাকে নাদেলা "এক্সজস্ট" (exhaust) বা অবশিষ্টাংশ বলেছেন। এটি হলো বাস্তব কাজের সময় তৈরি হওয়া সংশোধন, পছন্দের ডেটা এবং ইন্টারঅ্যাকশন লগ-এর একটি ছাপ।
এই 'এক্সজস্ট' কোনো ডিজিটাল আবর্জনা নয়। এতে প্রায়শই কঠোর পরিশ্রমের মাধ্যমে অর্জিত বিজনেস লজিক (business logic) থাকে। একটি লজিস্টিকস টিম হয়তো কোম্পানির বছরের পর বছর ধরে তৈরি করা অভ্যন্তরীণ সীমাবদ্ধতা (internal constraints) ব্যবহার করে শিপিং রুট অপ্টিমাইজ করার জন্য একটি মডেলকে প্রম্পট দিতে পারে। একটি আইনি বিভাগ হয়তো চুক্তির ভাষা বারবার সংশোধন করতে পারে যতক্ষণ না আউটপুটটি তাদের নিজস্ব স্টাইলের সাথে মিলে যায়। একটি ফার্মাসিউটিক্যাল গবেষণা গ্রুপ ক্লিনিকাল ডেটা এমনভাবে কুয়েরি করতে পারে যা তাদের কৌশলগত অগ্রাধিকারগুলো প্রকাশ করে দেয়। যখন এই ইন্টারঅ্যাকশনগুলো কোনো থার্ড-পার্টি API-এর মাধ্যমে প্রবাহিত হয়, তখন প্রোভাইডার পুরো আদান-প্রদানটি দেখতে পায়। মডেলটি শিখে ফেলে যে সেই নির্দিষ্ট ডোমেইনের জন্য ভালো উত্তর কেমন হওয়া উচিত।
সময়ের সাথে সাথে, এই ফিডব্যাক প্রোভাইডারের সাধারণ মডেলটিকে ঠিক সেই কাজগুলো করার ক্ষেত্রে আরও দক্ষ করে তোলে যার জন্য গ্রাহক এটিকে নিয়োগ করেছিল। এরপর প্রোভাইডার সেই উন্নত সক্ষমতা গ্রাহকের প্রতিদ্বন্দ্বীর কাছে বিক্রি করতে পারে, অথবা এমন একটি পার্শ্ববর্তী পণ্য বাজারে আনতে পারে যা সেই বিশেষায়িত ওয়ার্কফ্লোর অনুকরণ করে। মূল এন্টারপ্রাইজটি সাবস্ক্রিপশন ফি প্রদান করেছে, তাদের নিজস্ব বিশেষজ্ঞ জ্ঞান দান করেছে এবং কার্যত তাদের নিজেদের প্রতিদ্বন্দ্বীকে প্রশিক্ষণ দিয়েছে।
কেন সভরেন এআই (Sovereign AI) একটি শব্দ থেকে কৌশলে রূপান্তরিত হচ্ছে
এই ক্ষয় রোধ করার যৌক্তিক উপায় হলো লার্নিং লুপের ওপর নিয়ন্ত্রণ পুনরায় ফিরে পাওয়া। নাডেলার যুক্তিটি স্পষ্টতই মাইক্রোসফটকে এক ভিন্ন ধরনের ল্যান্ডলর্ড হিসেবে প্রতিষ্ঠিত করার জন্য সাজানো হয়েছে। গ্রাহকদের তাদের বুদ্ধিমত্তা একটি কেন্দ্রীভূত ব্ল্যাক বক্সে ইনপুট দিতে বাধ্য করার পরিবর্তে, তিনি এমন পরিবেশের পক্ষে কথা বলছেন যেখানে গ্রাহক নিজেই চাবিকাঠি বা নিয়ন্ত্রণ নিজের কাছে রাখতে পারেন।
এখানেই 'সার্ভারিন এআই' (sovereign AI) সংক্রান্ত আলোচনার ব্যবহারিক গুরুত্ব বৃদ্ধি পায়। একটি প্রাইভেট ক্লাউড, অন-প্রিমিস ডেটা সেন্টার বা একটি কঠোরভাবে নিয়ন্ত্রিত ভার্চুয়াল নেটওয়ার্কের মধ্যে মডেল চালানো মানে হলো ইন্টারঅ্যাকশন ডেটা কখনোই প্রতিষ্ঠানের সীমানা ছাড়িয়ে বাইরে যায় না। এন্টারপ্রাইজগুলো আধুনিক ফাউন্ডেশন মডেল থেকে সুবিধা পেলেও, এর ওয়েটস (weights), প্রম্পট এবং প্রেফারেন্স ডেটা কোম্পানির নিজস্ব নিয়ন্ত্রিত সীমানার মধ্যেই থাকে।
মাইক্রোসফট তাদের Azure ক্লাউড ব্যবসাকে ঠিক এই প্রাইভেট ডিপ্লয়মেন্ট এবং রিজিওনাল ডেটা রেসিডেন্সির প্রতিশ্রুতির ওপর ভিত্তি করেই গড়ে তুলেছে। তার পোস্টে নাডেলা ইঙ্গিত দিয়েছেন যে, মাইক্রোসফট এমন একটি প্ল্যাটফর্ম হতে চায় যেখানে এন্টারপ্রাইজগুলো তাদের মেধা সম্পদ অনিচ্ছাকৃতভাবে কোনো দূরবর্তী মডেল প্রোভাইডারের কাছে পাঠিয়ে না দিয়ে নিজেই তাদের ট্রেনিং এবং ইনফারেন্স হোস্ট করতে পারবে। এর প্রস্তাবটি অত্যন্ত সহজ: শক্তিশালী AI ব্যবহার করুন, কিন্তু আপনার উৎপাদিত ডেটা (exhaust) নিজের কাছেই রাখুন।
অন্যান্য ভেন্ডররাও একই ধরনের কথা বলছে, তবে মাইক্রোসফটের OpenAI-এর সাথে গভীর অংশীদারিত্বের কারণে নাডেলার এই পদক্ষেপটি বাড়তি গুরুত্ব বহন করে। এমন একজন সিইও (CEO) যার...
