ستیا نڈیلا نے ابھی ان لیبز کے ساتھ عوامی سطح پر جھگڑا شروع کیا ہے جنہیں بنانے میں ان کی اپنی کمپنی نے مدد کی تھی۔ مائیکروسافٹ کے چیف ایگزیکٹو نے ایک دو ٹوک وارننگ جاری کی ہے کہ کس طرح بڑی AI کمپنیاں ڈیٹا کی ملکیت کے قواعد کو دوبارہ لکھ رہی ہیں، اور یہ پیغام غیر معمولی اثر کے ساتھ پہنچا ہے۔ ایک حالیہ بلاگ پوسٹ میں، نڈیلا نے OpenAI اور Anthropic سمیت فرنٹیر لیبز پر ایک ہیرا پھیری شدہ مارکیٹ (rigged marketplace) بنانے کا الزام لگایا ہے۔ وہ بڑے ماڈلز کی تربیت کے لیے عوامی ڈیٹا اکٹھا کرتے ہیں، اور پھر اپنی سروس کی شرائط (terms of service) کا استعمال کرتے ہوئے کسی کو بھی ان ماڈلز کے تیار کردہ نتائج سے سیکھنے سے روک دیتے ہیں۔ ان کا کہنا ہے کہ اس کا نتیجہ قدر کی ایک طرفہ منتقلی ہے جس میں ادارے بل ادا کرتے رہتے ہیں جبکہ اپنی ملکیتی معلومات (proprietary knowledge) بھی کھو دیتے ہیں۔
ڈسٹلیشن کا دوہرا معیار (The Distillation Double Standard)
اس شکایت کو سمجھنے کے لیے، اس تکنیک پر نظر ڈالنا مددگار ثابت ہوگا جسے یہ لیبز روکنے کے لیے اتنی بے چین ہیں۔ ڈسٹلیشن (Distillation) تربیت کا ایک عام طریقہ ہے جہاں ایک چھوٹا، مخصوص ماڈل شروع سے انٹرنیٹ کے خام متن (raw internet text) کو جذب کرنے کے بجائے ایک بڑے ماڈل کے نتائج سے سیکھتا ہے۔ ایک اسٹارٹ اپ یا تحقیقی ٹیم ایک فرنٹیر ماڈل کو لاکھوں پرامپٹس (prompts) دے سکتی ہے، ان کے جوابات حاصل کر سکتی ہے، اور اس بھرپور سگنل کو ایک ایسے کمپیکٹ ماڈل کی تربیت کے لیے استعمال کر سکتی ہے جو مقامی طور پر چلتا ہو یا کسی خاص ضرورت کو پورا کرتا ہو۔ یہ ایک بنیاداتی ماڈل (foundation model) کو شروع سے بنانے کے مقابلے میں سستا اور توانائی کے لحاظ سے بہت کم خرچ ہے۔
OpenAI اور Anthropic دونوں اپنی سروس کی شرائط میں اس عمل کو ممنوع قرار دیتے ہیں۔ جب وہ منظم ڈسٹلیشن کا پتہ لگاتے ہیں، تو وہ اسے خلاف ورزی کے طور پر لیتے ہیں۔ اس کا نفاذ اکثر حریفوں، خاص طور پر چین میں مقیم AI کمپنیوں کو نشانہ بناتا ہے، جن پر الزام ہے کہ وہ اصل تربیت پر خرچ کیے گئے اربوں ڈالرز کے برابر صلاحیت حاصل کرنے کے بجائے اس طریقے کو استعمال کر کے صلاحیت کے فرق کو ختم کر رہی ہیں۔
نڈیلا نے اس پالیسی کے مرکز میں موجود تناؤ کو اجاگر کیا۔ انہی لیبز نے کھلے ویب (open web) کو کرال (crawl) کر کے، کتابیں، فورمز، کوڈ ریپوزٹریز اور مضامین اسکین کر کے اپنے فلیگ شپ ماڈلز بنائے، اور یہ سب اس قانونی دلیل کے تحت کیا گیا کہ عوامی طور پر دستیاب ڈیٹا پر تربیت کرنا 'فیئر یوز' (fair use) کے زمرے میں آتا ہے۔ انہوں نے مشترکہ وسائل (commons) سے ڈیٹا نکالا۔ پھر بھی اب وہ قانونی رکاوٹیں کھڑی کر رہے ہیں تاکہ کوئی بھی بدلے میں ان کے ماڈل کے نتائج کو عوامی تعلیمی مواد کے طور پر استعمال نہ کر سکے۔ ان کا انداز ایسا لگتا ہے جیسے وہ کہہ رہے ہوں کہ آپ دنیا کے کھلے علم سے سیکھ سکتے ہیں، لیکن ہم سے کوئی نہیں سیکھ سکتا۔
یہ عدم توازن محض علمی بحث سے بڑھ کر ہے۔ یہ ایک ایسی درجہ بندی (hierarchy) قائم کرتا ہے جہاں چند انفراسٹرکچر فراہم کنندگان یہ کنٹرول کرتے ہیں کہ کسے کیا معلوم ہونا چاہیے۔ اگر 'فیئر یوز' ان کے انسانی شائع شدہ ذہانت کے استعمال کو جائز قرار دیتا ہے، تو ان ماڈلز کے نتائج ایک نجی ملکیت (privatized commons) کی طرح نظر آنے لگتے ہیں۔ حریفوں اور صارفین دونوں کو اس سگنل کو نئے ٹولز میں تبدیل کرنے سے روک دیا جاتا ہے۔ اس کا تمام تر فائدہ صرف بڑے لیبز کو ہی مل رہا ہے۔
اپنی ہی ذہانت کے لیے دو بار ادائیگی کرنا
نڈیلا نے اس معاشی جال کے لیے ایک اصطلاح وضع کی ہے جو وہ بنتا ہوا دیکھ رہے ہیں: "ریورس انفارمیشن پیراڈوکس" (reverse information paradox)۔ ان کے خیال میں، ادارے اس وقت مصنوعی ذہانت کے لیے دو بار ادائیگی کر رہے ہیں، اور ان میں سے صرف ایک ادائیگی انوائس پر نظر آتی ہے۔
پہلا خرچ واضح ہے۔ کمپنیاں API کریڈٹس خریدتی ہیں، Copilot کی سبسکرپشن لیتی ہیں، یا چیٹ بوٹ سروسز کا لائسنس حاصل کرتی ہیں۔ دوسرا خرچ پوشیدہ ہے۔ ہر بار جب کوئی ملازم کسی غلط بیانی (hallucinated fact) کی تصحیح کرتا ہے، کسی جواب کو مددگار قرار دیتا ہے، یا تیار کردہ رپورٹ کو بہتر بناتا ہے، تو وہ عمل وہ پیدا کرتا ہے جسے نڈیلا "exhaust" کہتے ہیں۔ یہ اصل کام کے دوران تیار ہونے والی تصحیحات، ترجیحی ڈیٹا اور انٹرایکشن لاگز کا ایک سلسلہ ہے۔
یہ "exhaust" محض ڈیجیٹل کچرا نہیں ہے۔ اس میں اکثر مشکل سے حاصل کی گئی کاروباری منطق (business logic) شامل ہوتی ہے۔ ایک لاجسٹکس ٹیم کسی ماڈل کو کمپنی کے اندرونی طریقہ کار کو استعمال کرتے ہوئے شپنگ کے راستوں کو بہتر بنانے کے لیے پرامپٹ دے سکتی ہے، جسے تیار کرنے میں کمپنی نے سالوں صرف کیے ہوں۔ ایک قانونی شعبہ معاہدے کی زبان کو بار بار درست کر سکتا ہے جب تک کہ آؤٹ پٹ کمپنی کے مخصوص انداز سے مطابقت نہ رکھ لے۔ ایک فارماسیوٹیکل ریسرچ گروپ کلینیکل ڈیٹا کے بارے میں اس طرح سوالات پوچھ سکتا ہے جو اس کی تزویراتی ترجیحات (strategic priorities) کو ظاہر کریں۔ جب یہ تعاملات کسی تھرڈ پارٹی API کے ذریعے گزرتے ہیں، تو فراہم کنندہ مکمل تبادلہ دیکھ سکتا ہے۔ ماڈل سیکھ جاتا ہے کہ اس مخصوص شعبے کے لیے اچھے جوابات کیسے ہوتے ہیں۔
وقت کے ساتھ، یہ فیڈ بیک فراہم کنندہ کے جنرل ماڈل کو ان عین انہی کاموں میں زیادہ بہتر بنا دیتا ہے جن کے لیے صارف نے اسے ہائر کیا تھا۔ فراہم کنندہ پھر اسی بہتر صلاحیت کو صارف کے حریف کو بیچ سکتا ہے، یا کوئی ایسا ملتا جلتا پروڈکٹ لانچ کر سکتا ہے جو اس مخصوص ورک فلو کی نقل کرتا ہو۔ اصل ادارے نے سبسکرپشن فیس ادا کی، اپنی ملکیتی مہارت عطیہ کی، اور عملی طور پر اپنے ہی مقابلے کی تربیت کر دی۔
کیوں Sovereign AI محض ایک اصطلاح سے حکمت عملی میں تبدیل ہو رہا ہے
The logical response to this drain is to reclaim control over the learning loop. Nadella’s argument is clearly designed to position Microsoft as a different kind of landlord. Rather than insisting customers feed their intelligence into a centralized black box, he is making the case for environments where the customer keeps the keys.
This is where the conversation around sovereign AI gains practical weight. Running models inside a private cloud, an on-premise data center, or a tightly controlled virtual network means the interaction data never leaves the organization’s perimeter. The enterprise still benefits from modern foundation models, but the weights, the prompts, and the preference data remain inside a boundary the company administers.
Microsoft has built its Azure cloud business around exactly this promise of private deployments and regional data residency. In his post, Nadella signaled that Microsoft wants to be the platform where enterprises can host their own training and inference without inadvertently shipping their intellectual property to a distant model provider. The pitch is straightforward: use powerful AI, but keep your exhaust.
Other vendors are making similar noises, but Nadella’s intervention carries extra weight because of Microsoft’s deep partnership with OpenAI. For a CEO whose
