सत्य नडेला यांनी नुकतीच त्यांच्या कंपनीने विकसित करण्यास मदत केलेल्या प्रयोगशाळांशी (labs) जाहीर संघर्ष पुकारला आहे. मायक्रोसॉफ्टचे मुख्य कार्यकारी अधिकारी यांनी सर्वात मोठ्या AI कंपन्या डेटा मालकीचे नियम कसे बदलत आहेत, याबद्दल कडक इशारा दिला आहे आणि हा संदेश अत्यंत प्रभावीपणे पोहोचला आहे. एका अलीकडील ब्लॉग पोस्टमध्ये, नडेला यांनी OpenAI आणि Anthropic सारख्या आघाडीच्या प्रयोगशाळांवर एक पक्षपाती बाजारपेठ (rigged marketplace) तयार केल्याचा आरोप केला आहे. त्या प्रचंड मॉडेल्सना प्रशिक्षित करण्यासाठी सार्वजनिक डेटा गोळा करतात आणि नंतर त्यांचे सेवा नियम (terms of service) अशा प्रकारे लागू करतात की ज्यामुळे कोणीही त्या मॉडेल्सनी तयार केलेल्या आउटपुटमधून शिकू शकणार नाही. यामुळे मूल्याचे एकतर्फी हस्तांतरण होते, ज्यामध्ये कंपन्यांना खर्च करावा लागतो आणि त्यांना त्यांचे स्वतःचे मालकीचे ज्ञान (proprietary knowledge) गमवावे लागते, असा युक्तिवाद त्यांनी केला आहे.
डिस्टिलेशनचा दुटप्पीपणा
ही तक्रार समजून घेण्यासाठी, या प्रयोगशाळा ज्या तंत्राला रोखण्यासाठी इतक्या उत्सुक आहेत, त्याकडे पाहणे उपयुक्त ठरेल. डिस्टिलेशन (Distillation) ही एक सामान्य प्रशिक्षण पद्धत आहे जिथे एक लहान, विशेषीकृत मॉडेल (specialized model) शून्यापासून इंटरनेटवरील कच्चा मजकूर घेण्याऐवजी मोठ्या मॉडेलच्या आउटपुटमधून शिकते. एखादी स्टार्टअप किंवा संशोधन टीम एखाद्या आघाडीच्या मॉडेलला (frontier model) लाखो प्रॉम्प्ट्स देऊ शकते, त्यांच्या प्रतिसादांची नोंद करू शकते आणि त्या समृद्ध माहितीचा वापर करून एक कॉम्पॅक्ट मॉडेल प्रशिक्षित करू शकते, जे स्थानिक पातळीवर चालते किंवा विशिष्ट गरजा पूर्ण करते. हे शून्यापासून एखादे फाउंडेशन मॉडेल (foundation model) तयार करण्यापेक्षा स्वस्त आणि कमी ऊर्जा खर्चिक आहे.
OpenAI आणि Anthropic या दोन्ही कंपन्या त्यांच्या सेवा नियमांमध्ये या पद्धतीवर बंदी घालतात. जेव्हा त्यांना पद्धतशीर डिस्टिलेशन आढळते, तेव्हा ते त्याला नियमांचे उल्लंघन मानतात. अंमलबजावणी अनेकदा प्रतिस्पर्ध्यांना लक्ष्य करते, विशेषतः चीनमधील AI कंपन्यांना, ज्यांच्यावर मूळ प्रशिक्षणासाठी खर्च केलेल्या अब्जावधी डॉलर्सची बरोबरी न करता केवळ या पद्धतीचा वापर करून क्षमतांची तफावत भरून काढल्याचा आरोप केला जातो.
नडेला यांनी या धोरणाच्या केंद्रस्थानी असलेल्या तणावावर प्रकाश टाकला. या प्रयोगशाळांनी त्यांचे प्रमुख मॉडेल्स (flagship models) ओपन वेब क्रॉलिंग करून, पुस्तके, फोरम्स, कोड रिपॉझिटरीज आणि लेख स्क्रॅप करून तयार केले आहेत; आणि हे सर्व त्यांनी 'फेअर युज' (fair use) च्या कायदेशीर युक्तिवादाखाली केले आहे की सार्वजनिकरित्या उपलब्ध डेटावर प्रशिक्षण देणे हे कायदेशीर आहे. त्यांनी सार्वजनिक संसाधनांचा (commons) वापर केला. तरीही, आता ते त्यांच्या मॉडेलच्या आउटपुटला सार्वजनिक शैक्षणिक साहित्य म्हणून वापरण्यापासून रोखण्यासाठी कायदेशीर अडथळे निर्माण करत आहेत. "तुम्ही जगाच्या मुक्त ज्ञानापासून शिकू शकता, पण आमच्याकडून कोणीही शिकू शकत नाही," असे ते सुचवत आहेत.
ही विषमता केवळ शैक्षणिक चर्चेपुरती मर्यादित नाही. ती एक अशी श्रेणीबद्ध रचना (hierarchy) तयार करते जिथे काही मोजके पायाभूत सुविधा पुरवठादार (infrastructure providers) कोणाला काय माहिती मिळेल हे नियंत्रित करतात. जर 'फेअर युज' त्यांच्या मानवी बुद्धिमत्तेच्या वापराचे समर्थन करत असेल, तर त्या मॉडेल्सचे आउटपुट हे एका खासगी मालमत्तेसारखे (privatized commons) वाटू लागतात. स्पर्धक आणि ग्राहक दोघांनाही त्या माहितीचा वापर नवीन साधने तयार करण्यासाठी करण्यास मनाई केली जाते. यामुळे सर्व मार्ग केवळ मोठ्या प्रयोगशाळांकडेच वळतात.
तुमच्या स्वतःच्या बुद्धिमत्तेसाठी दोनदा पैसे मोजणे
नडेला यांनी तयार होत असलेल्या आर्थिक जाळ्यात एका शब्दाचा वापर केला आहे: "रिव्हर्स इन्फॉर्मेशन पॅराडॉक्स" (reverse information paradox). त्यांच्या मते, उद्योग सध्या कृत्रिम बुद्धिमत्तेसाठी (AI) दोनदा पैसे मोजत आहेत आणि त्यापैकी फक्त एकच पेमेंट बिलावर दिसते.
पहिला खर्च स्पष्ट आहे. कंपन्या API क्रेडिट्स खरेदी करतात, Copilot चे सबस्क्रिप्शन घेतात किंवा चॅटबॉट सेवांचे लायसन्स घेतात. दुसरा खर्च लपलेला आहे. जेव्हा जेव्हा एखादा कर्मचारी चुकीची माहिती दुरुस्त करतो, प्रतिसादाला उपयुक्त म्हणून रेटिंग देतो किंवा तयार केलेला अहवाल सुधारतो, तेव्हा ती कृती नडेला यांनी म्हटल्याप्रमाणे "एक्झॉस्ट" (exhaust) निर्माण करते. हे प्रत्यक्ष कामादरम्यान तयार झालेले सुधारणांचे, आवडीनिवडींचे आणि संवाद नोंदींचे (interaction logs) प्रमाण आहे.
हा 'एक्झॉस्ट' केवळ डिजिटल कचरा नाही. त्यामध्ये अनेकदा कष्टाने मिळवलेले व्यावसायिक तर्क (business logic) असतात. एखादी लॉजिस्टिक टीम कंपनीने वर्षानुवर्षे विकसित केलेल्या अंतर्गत मर्यादा वापरून शिपिंग मार्ग ऑप्टिमाइझ करण्यासाठी मॉडेलला प्रॉम्प्ट देऊ शकते. एखादा कायदेशीर विभाग कराराची भाषा जोपर्यंत कंपनीच्या शैलीशी जुळत नाही तोपर्यंत वारंवार दुरुस्त करू शकतो. फार्मास्युटिकल संशोधन गट धोरणात्मक प्राधान्ये उघड करणाऱ्या पद्धतीने क्लिनिकल डेटावर प्रश्न विचारू शकतो. जेव्हा हे संवाद थर्ड-पार्टी API द्वारे होतात, तेव्हा पुरवठादाराला संपूर्ण देवाणघेवाण दिसते. त्या विशिष्ट क्षेत्रासाठी चांगले उत्तर कसे असावे, हे मॉडेल शिकते.
कालांतराने, हा फीडबॅक पुरवठादाराच्या सामान्य मॉडेलला ग्राहकाने नेमक्या कोणत्या कामासाठी नियुक्त केले आहे, त्या कामात अधिक अचूक बनवतो. त्यानंतर पुरवठादार ते सुधारित कौशल्य ग्राहकाच्या प्रतिस्पर्ध्याला विकू शकतो किंवा त्या विशिष्ट कार्यप्रणालीची नक्कल करणारे नवीन उत्पादन लाँच करू शकतो. मूळ कंपनीने सबस्क्रिप्शन फी भरली, आपले खासगी ज्ञान दान केले आणि प्रभावीपणे स्वतःच्याच स्पर्धेला प्रशिक्षित केले.
सॉव्हरन AI (Sovereign AI) केवळ एक शब्द न राहता रणनीती का बनत आहे
या गळतीला तार्किक प्रतिसाद म्हणजे लर्निंग लूपवर (learning loop) पुन्हा नियंत्रण मिळवणे होय. नडेला यांचा युक्तिवाद स्पष्टपणे Microsoft ला एका वेगळ्या प्रकारच्या मालक (landlord) म्हणून प्रस्थापित करण्यासाठी तयार करण्यात आला आहे. ग्राहकांनी त्यांची बुद्धिमत्ता एका मध्यवर्ती 'ब्लॅक बॉक्स'मध्ये (black box) प्रवाहित करावी असा आग्रह धरण्याऐवजी, ते अशा वातावरणाचे समर्थन करत आहेत जिथे ग्राहकांकडेच सर्व चाव्या असतील.
येथेच 'सोव्हरिन AI' (sovereign AI) वरील चर्चेला व्यावहारिक महत्त्व प्राप्त होते. प्रायव्हेट क्लाउड (private cloud), ऑन-प्रिमाइस डेटा सेंटर (on-premise data center) किंवा घट्ट नियंत्रित व्हर्च्युअल नेटवर्कमध्ये मॉडेल्स चालवणे याचा अर्थ असा की, संवादाचा डेटा (interaction data) संस्थेच्या मर्यादेबाहेर कधीही जात नाही. उद्योगांना आधुनिक फाउंडेशन मॉडेल्सचा (foundation models) फायदा तरी मिळतोच, परंतु त्यांचे वेट्स (weights), प्रॉम्प्ट्स (prompts) आणि प्रेफरन्स डेटा (preference data) कंपनीच्या नियंत्रणाखालील मर्यादेतच राहतात.
Microsoft ने आपला Azure क्लाउड व्यवसाय नेमक्या याच प्रायव्हेट डिप्लॉयमेंट (private deployments) आणि प्रादेशिक डेटा रेसिडेन्सीच्या (regional data residency) आश्वासनावर उभारला आहे. आपल्या पोस्टमध्ये, नडेला यांनी संकेत दिला की Microsoft ला असे प्लॅटफॉर्म बनायचे आहे जिथे उद्योग आपली बौद्धिक संपदा (intellectual property) नकळतपणे एखाद्या दूरच्या मॉडेल प्रदात्याकडे पाठवल्याशिवाय स्वतःचे ट्रेनिंग आणि इन्फरन्स (training and inference) होस्ट करू शकतील. हे साधे आणि स्पष्ट आहे: शक्तिशाली AI वापरा, पण तुमचा डेटा (exhaust) स्वतःकडेच ठेवा.
इतर विक्रेतेही असेच दावे करत आहेत, परंतु OpenAI सोबतच्या Microsoft च्या सखोल भागीदारीमुळे नडेला यांच्या हस्तक्षेपामुळे अधिक महत्त्व प्राप्त होते. ज्या CEO साठी...
