सत्या नडेला ने अभी-अभी उन्हीं लैब्स के साथ सार्वजनिक रूप से विवाद खड़ा कर दिया है जिन्हें बनाने में उनकी कंपनी ने मदद की थी। माइक्रोसॉफ्ट के मुख्य कार्यकारी ने इस बारे में एक स्पष्ट चेतावनी जारी की कि कैसे सबसे बड़ी AI कंपनियां डेटा स्वामित्व के नियमों को फिर से लिख रही हैं, और यह संदेश असामान्य रूप से प्रभावशाली रहा। एक हालिया ब्लॉग पोस्ट में, नडेला ने OpenAI और Anthropic सहित फ्रंटियर लैब्स पर एक पक्षपाती बाजार (rigged marketplace) बनाने का आरोप लगाया। वे विशाल मॉडलों को प्रशिक्षित करने के लिए सार्वजनिक डेटा का उपयोग करते हैं, और फिर अपनी सेवा की शर्तों (terms of service) का उपयोग करके किसी को भी उन मॉडलों द्वारा उत्पन्न आउटपुट से सीखने से रोकते हैं। उनका तर्क है कि इसका परिणाम मूल्य का एकतरफा हस्तांतरण है, जिससे उद्यम अपना मालिकाना ज्ञान सौंपते हुए बिल का भुगतान करते रह जाते हैं।
डिस्टिलेशन का दोहरा मापदंड
इस शिकायत को समझने के लिए, उस तकनीक पर नज़र डालना मददगार होगा जिसे ये लैब्स रोकने के लिए इतनी उत्सुक हैं। डिस्टिलेशन एक सामान्य प्रशिक्षण पद्धति है जहाँ एक छोटा, विशिष्ट मॉडल शून्य से कच्चा इंटरनेट टेक्स्ट लेने के बजाय एक बड़े मॉडल के आउटपुट से सीखता है। एक स्टार्टअप या रिसर्च टीम एक फ्रंटियर मॉडल को लाखों प्रॉम्प्ट दे सकती है, उनके जवाबों को कैप्चर कर सकती है, और उस समृद्ध सिग्नल का उपयोग एक कॉम्पैक्ट मॉडल को प्रशिक्षित करने के लिए कर सकती है जो स्थानीय रूप से चलता है या किसी विशिष्ट आवश्यकता को पूरा करता है। यह ज़ीरो से एक फाउंडेशन मॉडल बनाने की तुलना में सस्ता और बहुत कम ऊर्जा-गहन (energy-intensive) है।
OpenAI और Anthropic दोनों अपनी सेवा की शर्तों में इस प्रथा को प्रतिबंधित करते हैं। जब वे व्यवस्थित डिस्टिलेशन का पता लगाते हैं, तो वे इसे उल्लंघन मानते हैं। प्रवर्तन (Enforcement) अक्सर प्रतिद्वंद्वियों को निशाना बनाता है, विशेष रूप से चीन में स्थित AI कंपनियों को, जिन पर मूल प्रशिक्षण (original training runs) पर खर्च किए गए अरबों डॉलर के बराबर क्षमता हासिल करने के लिए इस पद्धति का उपयोग करने का आरोप लगाया जाता है।
नडेला ने इस नीति के केंद्र में मौजूद तनाव को रेखांकित किया। इन्हीं लैब्स ने ओपन वेब को क्रॉल करके, किताबें, फ़ोरम, कोड रिपॉजिटरी और लेखों को स्क्रैप करके अपने फ्लैगशिप मॉडल बनाए, और यह सब इस कानूनी तर्क के तहत किया गया कि सार्वजनिक रूप से सुलभ डेटा पर प्रशिक्षण लेना 'फेयर यूज़' (fair use) के अंतर्गत आता है। उन्होंने सार्वजनिक संपदा (commons) का दोहन किया। फिर भी, अब वे कानूनी घेरे (legal fences) तैनात करते हैं ताकि कोई भी बदले में उनके मॉडल आउटपुट को सार्वजनिक शिक्षण सामग्री के रूप में उपयोग न कर सके। वे ऐसा कहते प्रतीत होते हैं जैसे, "आप दुनिया के खुले ज्ञान से सीख सकते हैं, लेकिन हमसे कोई नहीं सीख सकता।"
यह विषमता (asymmetry) अकादमिक बहस से कहीं अधिक महत्वपूर्ण है। यह एक ऐसा पदानुक्रम (hierarchy) स्थापित करता है जहाँ मुट्ठी भर इंफ्रास्ट्रक्चर प्रदाता यह नियंत्रित करते हैं कि किसे क्या जानने का अधिकार है। यदि 'फेयर यूज़' मानवता की प्रकाशित बुद्धिमत्ता के उनके उपयोग को उचित ठहराता है, तो उन मॉडलों के आउटपुट एक निजीकृत सार्वजनिक संपदा (privatized commons) की तरह दिखने लगते हैं। प्रतिस्पर्धियों और ग्राहकों दोनों को उस सिग्नल को नए टूल में बदलने से रोका जाता है। सारा रास्ता केवल सबसे बड़ी लैब्स की ओर जाता है।
अपनी ही बुद्धिमत्ता के लिए दो बार भुगतान करना
नडेला ने उस आर्थिक जाल के लिए एक वाक्यांश गढ़ा है जिसे वे बनते हुए देख रहे हैं: "रिवर्स इंफॉर्मेशन पैराडॉक्स" (reverse information paradox)। उनके विचार में, उद्यम वर्तमान में आर्टिफिशियल इंटेलिजेंस के लिए दो बार भुगतान कर रहे हैं, और उन भुगतानों में से केवल एक ही इनवॉइस (invoice) पर दिखाई देता है।
पहला खर्च स्पष्ट है। कंपनियां API क्रेडिट खरीदती हैं, Copilot की सदस्यता लेती हैं, या चैटबॉट सेवाओं का लाइसेंस लेती हैं। दूसरा खर्च छिपा हुआ है। हर बार जब कोई कर्मचारी किसी गलत तथ्य (hallucinated fact) को सुधारता है, किसी प्रतिक्रिया को सहायक के रूप में रेट करता है, या किसी जनरेटेड रिपोर्ट को रिफाइन करता है, तो वह क्रिया वह पैदा करती है जिसे नडेला "एग्जॉस्ट" (exhaust) कहते हैं। यह वास्तविक काम के दौरान उत्पन्न होने वाले सुधारों, प्राथमिकता डेटा और इंटरैक्शन लॉग का एक निशान है।
यह 'एग्जॉस्ट' डिजिटल कचरा नहीं है। इसमें अक्सर कठिन परिश्रम से प्राप्त बिजनेस लॉजिक (business logic) होता है। एक लॉजिस्टिक्स टीम कंपनी द्वारा वर्षों तक विकसित किए गए आंतरिक प्रतिबंधों (internal constraints) का उपयोग करके शिपिंग रूट को अनुकूलित करने के लिए एक मॉडल को प्रॉम्प्ट दे सकती है। एक कानूनी विभाग अनुबंध की भाषा को तब तक बार-बार सुधार सकता है जब तक कि आउटपुट कंपनी की शैली (house style) से मेल न खा जाए। एक फार्मास्युटिकल रिसर्च ग्रुप क्लिनिकल डेटा से इस तरह सवाल पूछ सकता है जो रणनीतिक प्राथमिकताओं को प्रकट करते हैं। जब वे इंटरैक्शन किसी थर्ड-पार्टी API के माध्यम से प्रवाहित होते हैं, तो प्रदाता पूरा आदान-प्रदान देख लेता है। मॉडल सीख जाता है कि उस विशिष्ट डोमेन के लिए अच्छे उत्तर कैसे दिखते हैं।
समय के साथ, यह फीडबैक प्रदाता के सामान्य मॉडल को उन सटीक कार्यों में अधिक सटीक बनाता है जिन्हें करने के लिए ग्राहक ने उसे काम पर रखा था। प्रदाता फिर मुड़कर उस बेहतर क्षमता को ग्राहक के प्रतिस्पर्धी को बेच सकता है, या एक ऐसा आसन्न उत्पाद (adjacent product) लॉन्च कर सकता है जो उस विशिष्ट वर्कफ़्लो की नकल करता है। मूल उद्यम ने सदस्यता शुल्क का भुगतान किया, अपनी मालिकाना विशेषज्ञता दान कर दी, और प्रभावी रूप से अपने ही प्रतिस्पर्धी को प्रशिक्षित कर दिया।
क्यों सॉवरेन AI एक चर्चा का विषय (buzzword) से रणनीति की ओर बढ़ रहा है
The logical response to this drain is to reclaim control over the learning loop. Nadella’s argument is clearly designed to position Microsoft as a different kind of landlord. Rather than insisting customers feed their intelligence into a centralized black box, he is making the case for environments where the customer keeps the keys.
This is where the conversation around sovereign AI gains practical weight. Running models inside a private cloud, an on-premise data center, or a tightly controlled virtual network means the interaction data never leaves the organization’s perimeter. The enterprise still benefits from modern foundation models, but the weights, the prompts, and the preference data remain inside a boundary the company administers.
Microsoft has built its Azure cloud business around exactly this promise of private deployments and regional data residency. In his post, Nadella signaled that Microsoft wants to be the platform where enterprises can host their own training and inference without inadvertently shipping their intellectual property to a distant model provider. The pitch is straightforward: use powerful AI, but keep your exhaust.
Other vendors are making similar noises, but Nadella’s intervention carries extra weight because of Microsoft’s deep partnership with OpenAI. For a CEO whose
