मोठ्या प्रमाणावर AI मॉडेल चालवणे हे आता वैज्ञानिक कामगिरीपेक्षा वीज बिले आणि डेटासेंटरच्या भाड्याचा एक कठीण गणिती प्रश्न बनले आहे. Gemini ने तयार केलेला प्रत्येक टोकन Google ला प्रत्यक्ष खर्च लावून देतो—सिलिकॉन सायकल, मेमरी बँडविड्थ आणि वीज वापर. क्वेरीचे प्रमाण जसजसे वाढते, तसतसे एक सेंटचे काही अंश देखील इतक्या मोठ्या रकमेत रूपांतरित होतात की ते नफा (margins) पूर्णपणे गिळंकृत करू शकतात. हीच शांत आणीबाणी Frozen v2 च्या मागे आहे, जो Google मधील एक अंतर्गत सर्व्हर चिप प्रकल्प आहे जो आता आकार घेत आहे. आपल्या सामान्य-उद्देशीय (general-purpose) Tensor Processing Units ला आणखी एका पिढीसाठी सुधारण्याऐवजी, कंपनी काहीतरी अधिक क्रांतिकारी करण्याचा प्रयत्न करत आहे: Gemini मॉडेलचा सांगाडा थेट सिलिकॉनमध्येच कोरण्याचा.

लवचिक अ‍ॅक्सिलरेटर्सपासून मॉडेल-विशिष्ट सिलिकॉनपर्यंत

Google चे TPUs गेल्या जवळपास एका दशकापासून त्यांच्या इन्फ्रास्ट्रक्चरचे मुख्य आधारस्तंभ राहिले आहेत. ते मॉडेल्सना प्रशिक्षित करतात, सर्च रँकिंग अल्गोरिदमला शक्ती देतात आणि Meta सह क्लाउड ग्राहकांना तासावर भाड्याने देखील देतात, जे Nvidia च्या GPUs ला पर्याय शोधत आहेत. हीच अष्टपैलुत्व एका TPU ला TPU बनवते. ते मॅट्रिक्स मल्टिप्लिकेशन आणि मेमरी मूव्हमेंटची एक सामान्य भाषा वापरते, जी सॉफ्टवेअरमध्ये तुम्ही वर्णन करू शकणाऱ्या जवळजवळ कोणत्याही न्यूरल नेटवर्कद्वारे वापरली जाऊ शकते.

Frozen v2 मुद्दाम ती लवचिकता सोडून देते. ही चिप एका डोमेन-विशिष्ट अ‍ॅक्सिलरेटर म्हणून डिझाइन केली जात आहे, ज्याचे सर्किट्स भौतिकरित्या Gemini च्या स्वतःच्या आर्किटेक्चरचा भाग प्रतिबिंबित करतात. जिथे TPU सूचना मिळवते आणि त्यांचे सॉफ्टवेअर ऑपरेशन्स म्हणून अर्थ लावतो, तिथे Frozen v2 मॉडेलचा स्ट्रक्चरल ब्लूप्रिंट—त्याचे लेयर्स आणि डेटा पाथ्सची रचना—थेट चिपच्या लेआउटमध्ये कोरून टाकेल. Google ला अशी अपेक्षा आहे की मॉडेल आणि मेटल यांच्या या घनिष्ठ संबंधामुळे AI प्रतिसाद देण्यासाठी ही चिप सध्याच्या TPUs पेक्षा सहा ते दहा पटीने अधिक कार्यक्षम बनेल. प्रति क्वेरी कमी कम्प्युट स्टेप्स म्हणजे टोकन येण्यासाठी कमी प्रतीक्षा वेळ आणि ते तयार करण्यासाठी खर्च होणारी ऊर्जा देखील खूप कमी.

हे केवळ त्याच कल्पनेचे वेगवान व्हर्जन नाही. ही चिपची एक वेगळी श्रेणी आहे, जी सर्वसाधारणपणाच्या बदल्यात एका विशिष्ट मॉडेल फॅमिलीसाठी समर्पित आहे.

पहिले “Frozen” का वितळले

या दृष्टिकोनाची मुळे Google DeepMind चे मुख्य शास्त्रज्ञ जेफ डीन यांच्या एका जुन्या संकल्पनेत आहेत. मूळ “Frozen” प्रस्तावात केवळ आर्किटेक्चरच नाही, तर प्रत्यक्ष मॉडेल वेट्स—Gemini च्या शिकलेल्या वर्तनाचे घटक असलेले अब्जावधी ट्यून केलेले पॅरामीटर्स—थेट चिपमध्येच हार्डकोड करून विशेषीकरण (specialization) आणखी पुढे नेण्याचा सल्ला देण्यात आला होता.

तर्क योग्य होते. जर तुम्हाला मॉडेल नेमके कोणते नंबर वापरणार आहे हे माहित असेल, तर ते बाह्य मेमरीमधून मिळवण्यासाठी कशाला त्रास करून घ्यावा? तुम्ही ते ट्रान्झिस्टरमध्ये कोरू शकता आणि विलंब (delay) पूर्णपणे काढून टाकू शकता.

समस्या होती कायमस्वरूपी असण्याची. AI मॉडेल्स स्थिर नसतात. Google Gemini ला सतत अपडेट करते, नवीन डेटावर पुन्हा प्रशिक्षित करते, पॅरामीटर्स समायोजित करते आणि सुधारित आवृत्त्या लाँच करते. सिलिकॉनमध्ये वेट्स गोठवलेली (frozen) चिप, नवीन मॉडेल रिव्हिजन येताच केवळ एक 'पेपरवेट' ठरेल. लवचिकतेच्या अभावामुळे मूळ संकल्पना मागे पडली.

अँकरशिवाय आर्किटेक्चर

Frozen v2 आर्किटेक्चर हार्डकोड करते पण वेट्स बदलण्यासाठी मुक्त ठेवते, ज्यामुळे ही संकल्पना कालबाह्य होण्याच्या जाळ्यातून सुटते. हे एखाद्या कारला रस्त्याला वेल्ड करण्याऐवजी, एक कस्टम रेसट्रॅक तयार करण्यासारखे आहे. सर्किटचा आकार स्थिर राहतो, जो Gemini च्या विशिष्ट कम्प्युटेशन पॅटर्नसाठी ऑप्टिमाइझ केलेला असतो, परंतु त्या सर्किट्समधून वाहणारी माहिती मेमरीमधून नवीन वेट्स लोड करून रिफ्रेश केली जाऊ शकते.

व्यवहारात हा फरक महत्त्वाचा आहे. जेव्हा इंजिनिअर्स नवीन Gemini चेकपॉइंट प्रशिक्षित करतात, तेव्हा ते नवीन चिप तयार न करता ते Frozen v2 हार्डवेअरवर तैनात करू शकतात. हार्डकोडिंगची नेमकी पातळी हा अजूनही Google मधील एक प्रश्न आहे; कोणत्या स्ट्रक्चरल घटकांना सिलिकॉनमध्ये कायमस्वरूपी स्थान मिळायला हवे आणि कोणते कॉन्फिगर करण्यायोग्य राहिले पाहिजेत, याचा निर्णय टीम्सना घ्यावा लागेल. परंतु तत्व निश्चित झाले आहे. आकार गोठवून (freezing) आणि पॅरामीटर्स लवचिकपणे बदलून, Google पुनरावृत्ती (iterate) करण्याची क्षमता न गमावता कार्यक्षमतेचा फायदा घेत आहे.

ते इन-हाऊस ठेवण्याचे अर्थशास्त्र

एक दुसरे कारण म्हणजे तुम्हाला Frozen v2 Google Cloud च्या प्राइसिंग शीटवर दिसणार नाही. कारण ही चिप Gemini च्या अंतर्गत रचनेनुसार इतकी जवळून तयार केली गेली आहे की, PyTorch किंवा कस्टम Transformer व्हेरिएंट्स वापरणाऱ्या बाह्य डेव्हलपर्ससाठी याचा फारसा उपयोग होणार नाही. Google कडे हे सामान्य-उद्देशीय उत्पादन म्हणून विकण्याची कोणतीही योजना नाही. हे एक अंतर्गत साधन म्हणून राहील, ज्याचे मुख्य उद्दिष्ट Google च्या स्वतःच्या डेटासेंटर्समधील इन्फरन्स क्षमतेची (inference capacity) प्रचंड मागणी पूर्ण करणे हे आहे.

हा निर्णय एका कठोर आर्थिक वास्तवाचे प्रतिबिंब आहे. सध्याच्या जनरेटिव्ह AI मार्केटमध्ये, मॉडेल्सची क्षमता वेगाने एकमेकांच्या जवळ येत आहे. स्पर्धकांमधील फरक अनेकदा यावर अवलंबून असतो की कोण सर्वात मोठे मॉडेल प्रति टोकन सर्वात कमी खर्चात चालवू शकते. इन्फरन्स (Inference) आता ट्रेनिंगनंतरचा केवळ एक विचार उरला नाही; Gemini सारख्या मोठ्या प्रमाणावर वापरल्या जाणाऱ्या उत्पादनासाठी, हा सर्वात मोठा खर्च आहे. जर Frozen v2 ने हा खर्च सहा पटीने किंवा त्याहून अधिक प्रमाणात कमी केला, तर Google ला अशी संधी मिळेल जी स्पर्धक सहजपणे मिळवू शकणार नाहीत. Google ही बचत स्वतःच्या नफ्यात (margin) घेऊ शकते किंवा API ग्राहक आणि उत्पादन एकत्रीकरणासाठी (product integrations) कमी किमतींच्या स्वरूपात देऊ शकते, ज्यामुळे OpenAI, Anthropic आणि इतरांवरील दबाव वाढेल.

यातून उद्योगासाठी काय संकेत मिळतात

Google च्या या पावलामुळे व्यापक हार्डवेअर धोरण कोणत्या दिशेने जात आहे, याचेही संकेत मिळतात. अनेक वर्षे, शक्य तितका लवचिक अ‍ॅक्सिलरेटर (accelerator) तयार करणे आणि विशेष कामांसाठी सॉफ्टवेअरवर अवलंबून राहणे, हेच मानक धोरण होते. Nvidia चे GPUs वर्चस्व गाजवतात कारण ते मॉलिक्युलर डायनॅमिक्सपासून ते व्हिडिओ गेम्स आणि लार्ज लँग्वेज मॉडेल्सपर्यंत सर्व काही चालवू शकतात. Google चे स्वतःचे TPUs देखील याच व्यापक उपयुक्ततेच्या भावनेने तयार करण्यात आले होते.

Frozen v2 या परंपरेतून बाहेर पडते. हे मान्य करणे आहे की जेव्हा एखादा मॉडेल फॅमिली पुरेसा क्वेरी वॉल्यूम (query volume) निर्माण करते, तेव्हा त्या मॉडेलसाठी खास तयार केलेले कस्टम सिलिकॉन (custom silicon) स्वतःचा खर्च अनेक पटीने भरून काढू शकते. इतर हायपरस्केलर्सनी (hyperscalers) देखील अशाच प्रकारचे तर्क वापरले आहेत—उदाहरणार्थ, Amazon चे Trainium आणि Inferentia चिप्स—परंतु Google चा दृष्टिकोन अधिक सखोल आहे, कारण ते केवळ सामान्य नेटवर्क वर्गाऐवजी एका विशिष्ट मॉडेल आर्किटेक्चरभोवती हार्डवेअरचे सह-डिझाइन (co-designing) करत आहेत.

अर्थात, यात जोखीम म्हणजे ताठरता (rigidity). जर Gemini चे आर्किटेक्चर अशा दिशेने विकसित झाले जे हार्डकोडेड सर्किट्समध्ये बसू शकणार नाही, तर Google कडे असे महागडे सिलिकॉन असू शकते जे त्यांचे नवीन विचार राबवू शकणार नाही. म्हणूनच केवळ आर्किटेक्चरवर आधारित हा तडजोड (compromise) महत्त्वाचा आहे. हे एक मध्यम मार्ग प्रदान करते: कार्यक्षमतेत मोठी वाढ करण्यासाठी पुरेशी विशेषीकरण (specialization) आणि कंपनीला अडचणीत टाकण्यापासून वाचवण्यासाठी पुरेशी लवचिकता.

मुख्य निष्कर्ष

Frozen v2 ला केवळ चिपची घोषणा म्हणून न समजता, AI स्पर्धेच्या भविष्यातील स्वरूपावर लावलेला एक धोरणात्मक डाव (strategic bet) म्हणून समजून घेणे अधिक योग्य ठरेल. Google असा दावा करत आहे की विजेते केवळ सर्वोत्तम मॉडेल्स तयार करणार नाहीत, तर ते संपूर्ण स्टॅकवर (stack) ताबा मिळवतील—मॉडेलच्या ब्ल्यूप्रिंटपासून ते ट्रान्झिस्टरमधून वाहणाऱ्या इलेक्ट्रॉन्सपर्यंत. जर हा प्रकल्प यशस्वी झाला, तर त्याचा फायदा बेंचमार्क स्कोअरमध्ये दिसणार नाही. तो त्रैमासिक कमाई अहवालातील (quarterly earnings report) खर्चाच्या कॉलममध्ये दिसून येईल, जिथे प्रति दशलक्ष टोकन्सवर वाचवलेले काही सेंट्स जनरेटिव्ह AI मध्ये व्यावसायिकदृष्ट्या काय शक्य आहे, याच्या सीमा पुन्हा आखू शकतात.