बड़े पैमाने पर एक बड़े AI मॉडल को चलाना अब वैज्ञानिक उपलब्धि से अधिक बिजली के बिलों और डेटासेंटर के किराए से जुड़ी एक कठिन गणितीय समस्या बन गया है। Gemini द्वारा जनरेट किया गया हर टोकन Google के लिए वास्तविक लागत लाता है—सिलिकॉन साइकिल, मेमोरी बैंडविड्थ और बिजली की खपत। जैसे-जैसे क्वेरी की मात्रा बढ़ती है, एक सेंट का छोटा सा हिस्सा भी ऐसे बड़े आंकड़ों में बदल जाता है जो मुनाफे को पूरी तरह खत्म कर सकते हैं। यही शांत तात्कालिकता Frozen v2 के पीछे है, जो Google के भीतर आकार ले रहा एक आंतरिक सर्वर चिप प्रोजेक्ट है। अपनी अगली पीढ़ी के लिए सामान्य-उद्देश्य वाले Tensor Processing Units को और बेहतर बनाने के बजाय, कंपनी कुछ बहुत अधिक क्रांतिकारी करने की कोशिश कर रही है: Gemini मॉडल के ढांचे (skeleton) को सीधे सिलिकॉन में ही ढालना।

लचीले एक्सेलेरेटर्स से मॉडल-विशिष्ट सिलिकॉन तक

Google के TPUs लगभग एक दशक से उसके इंफ्रास्ट्रक्चर के वर्कहॉर्स रहे हैं। वे मॉडल को ट्रेन करते हैं, सर्च रैंकिंग एल्गोरिदम को शक्ति देते हैं, और यहाँ तक कि Meta सहित अन्य क्लाउड ग्राहकों को प्रति घंटे के आधार पर किराए पर भी दिए जाते हैं, जो Nvidia के GPUs का विकल्प तलाश रहे हैं। यही बहुमुखी प्रतिभा एक TPU को TPU बनाती है। यह मैट्रिक्स गुणन (matrix multiplication) और मेमोरी मूवमेंट की एक सामान्य शब्दावली का उपयोग करता है, जिसे सॉफ्टवेयर में वर्णित लगभग किसी भी न्यूरल नेटवर्क द्वारा उपयोग किया जा सकता है।

Frozen v2 जानबूझकर उस लचीलेपन का त्याग करता है। इस चिप को एक डोमेन-विशिष्ट एक्सेलेरेटर के रूप में डिज़ाइन किया जा रहा है जिसके सर्किट भौतिक रूप से Gemini के अपने आर्किटेक्चर के हिस्सों को दर्शाते हैं। जहाँ एक TPU निर्देशों को प्राप्त करता है और उन्हें सॉफ्टवेयर ऑपरेशन्स के रूप में व्याख्यायित करता है, वहीं Frozen v2 मॉडल के स्ट्रक्चरल ब्लूप्रिंट—इसके लेयर्स और डेटा पाथ के अरेंजमेंट—को सीधे चिप के लेआउट में ही 'बर्न' (अंकित) कर देगा। Google को उम्मीद है कि मॉडल और मेटल (सिलिकॉन) का यह गहरा मेल AI रिस्पॉन्स देने में चिप को वर्तमान TPUs की तुलना में छह से दस गुना अधिक कुशल बनाएगा। प्रति क्वेरी कम कंप्यूट स्टेप्स का मतलब है कि टोकन के आने का इंतज़ार करने में कम समय लगेगा, और उसे जनरेट करने में बहुत कम ऊर्जा खर्च होगी।

यह केवल उसी विचार का एक तेज़ संस्करण नहीं है। यह चिप की एक अलग श्रेणी है, जो व्यापकता (generality) के बदले एक एकल मॉडल परिवार के प्रति समर्पण का विकल्प चुनती है।

पहला “Frozen” क्यों पिघल गया

इस दृष्टिकोण की जड़ें Google DeepMind के मुख्य वैज्ञानिक जेफ डीन (Jeff Dean) से जुड़े एक पुराने विचार में हैं। मूल “Frozen” प्रस्ताव में न केवल आर्किटेक्चर को, बल्कि वास्तविक मॉडल वेट्स (weights)—वे अरबों ट्यून्ड पैरामीटर्स जो Gemini के सीखे हुए व्यवहार का निर्माण करते हैं—को सीधे चिप में ही हार्डकोड करके विशेषज्ञता (specialization) को और आगे बढ़ाने का सुझाव दिया गया था।

तर्क सही था। यदि आप सटीक रूप से जानते हैं कि मॉडल किन नंबरों का उपयोग करेगा, तो उन्हें बाहरी मेमोरी से लाने की क्या आवश्यकता है? आप उन्हें ट्रांजिस्टर में ही उकेर सकते हैं और देरी (delay) की पूरी श्रेणियों को समाप्त कर सकते हैं।

समस्या स्थायित्व (permanence) की थी। AI मॉडल स्थिर नहीं रहते। Google लगातार Gemini को अपडेट करता है, नए डेटा पर फिर से ट्रेन करता है, पैरामीटर्स को एडजस्ट करता है और बेहतर वर्ज़न जारी करता है। सिलिकॉन में जमे हुए (frozen) वेट्स वाली चिप उस क्षण एक 'पेपरवेट' बन जाएगी जब नया मॉडल रिवीज़न जारी होगा। लचीलेपन की इसी कमी ने मूल अवधारणा को खत्म कर दिया।

बिना लंगर के आर्किटेक्चर

Frozen v2 आर्किटेक्चर को हार्डकोड करके और वेट्स को बदलने के लिए स्वतंत्र छोड़कर अप्रचलन (obsolescence) के जाल को हल करता है। इसे कार को सड़क पर वेल्ड करने के बजाय एक कस्टम रेसट्रैक बनाने के रूप में सोचें। सर्किट का आकार स्थिर रहता है, जो Gemini के विशिष्ट कंप्यूटेशन पैटर्न के लिए अनुकूलित होता है, लेकिन उन सर्किटों से बहने वाली सामग्री को मेमोरी से नए वेट्स लोड करके रिफ्रेश किया जा सकता है।

व्यवहार में यह अंतर महत्वपूर्ण है। जब इंजीनियर एक नया Gemini चेकपॉइंट ट्रेन करते हैं, तो वे बिना नया चिप बनाए उसे Frozen v2 हार्डवेयर पर तैनात कर सकते हैं। हार्डकोडिंग की सटीक सीमा अभी भी Google के भीतर एक खुला प्रश्न है; टीमों को यह तय करना होगा कि किन संरचनात्मक तत्वों को सिलिकॉन अमरता (silicon immortality) मिलनी चाहिए और किन्हें कॉन्फ़िगर करने योग्य रहना चाहिए। लेकिन सिद्धांत तय है। आकार को स्थिर रखकर और पैरामीटर्स को सुचारू रूप से बदलकर, Google सुधार (iterate) करने की क्षमता से समझौता किए बिना दक्षता का लाभ बनाए रखता है।

इसे इन-हाउस रखने का अर्थशास्त्र

एक और कारण है कि आप Frozen v2 को Google Cloud के प्राइसिंग शीट पर नहीं देखेंगे। क्योंकि यह चिप Gemini के आंतरिक कामकाज के इर्द-गिर्द इतनी गहराई से बनी है, इसलिए PyTorch या कस्टम Transformer वेरिएंट चलाने वाले बाहरी डेवलपर्स के लिए इसका बहुत कम महत्व होगा। Google की इसे एक सामान्य-उद्देश्य वाले उत्पाद के रूप में बेचने की कोई योजना नहीं है। यह एक आंतरिक उपकरण बना रहेगा, जिसका सीधा लक्ष्य Google के अपने डेटासेंटरों के भीतर इन्फरेंस क्षमता (inference capacity) की भारी मांग को पूरा करना है।

यह चुनाव एक कठोर आर्थिक वास्तविकता को दर्शाता है। वर्तमान जनरेटिव AI बाजार में, मॉडल की क्षमताएं तेजी से एक समान हो रही हैं। प्रतिस्पर्धियों के बीच का अंतर अक्सर इस बात पर निर्भर करता है कि कौन प्रति टोकन सबसे कम लागत पर सबसे बड़े मॉडल को चलाने का खर्च उठा सकता है। इन्फरेंस (Inference) अब ट्रेनिंग के बाद का कोई गौण विचार नहीं रह गया है; Gemini जैसे व्यापक रूप से उपयोग किए जाने वाले उत्पाद के लिए, यह सबसे बड़ा खर्च है। यदि Frozen v2 उस खर्च को छह गुना या उससे अधिक कम कर देता है, तो Google को ऐसी बढ़त मिल जाती है जिसे प्रतिस्पर्धी आसानी से टक्कर नहीं दे सकते। यह या तो बचत को मार्जिन के रूप में रख सकता है या API उपभोक्ताओं और उत्पाद एकीकरण (product integrations) के लिए कम कीमतों के रूप में दे सकता है, जिससे OpenAI, Anthropic और अन्य कंपनियों पर दबाव बढ़ जाएगा।

यह उद्योग के लिए क्या संकेत देता है

Google का यह कदम इस ओर भी इशारा करता है कि व्यापक हार्डवेयर रणनीति किस दिशा में जा रही है। वर्षों से, मानक तरीका जितना संभव हो सके उतना लचीला एक्सेलेरेटर बनाना और विशेषज्ञता (specialization) को सॉफ्टवेयर पर छोड़ देना था। Nvidia के GPUs का दबदबा है क्योंकि वे मॉलिक्यूलर डायनेमिक्स से लेकर वीडियो गेम और लार्ज लैंग्वेज मॉडल्स तक सब कुछ चला सकते हैं। Google के अपने TPUs भी व्यापक उपयोगिता की इसी भावना के साथ बनाए गए थे।

Frozen v2 उस परंपरा से अलग है। यह इस बात की स्वीकारोक्ति है कि जब एक ही मॉडल फैमिली पर्याप्त क्वेरी वॉल्यूम संचालित करती है, तो उस मॉडल के लिए विशेष रूप से तैयार किया गया कस्टम सिलिकॉन कई गुना अधिक लाभ दे सकता है। अन्य हाइपरस्केलर्स ने भी इसी तरह के तर्क का पालन किया है—उदाहरण के लिए, Amazon के Trainium और Inferentia चिप्स—लेकिन Google का दृष्टिकोण नेटवर्क के एक सामान्य वर्ग के बजाय एक विशिष्ट मॉडल आर्किटेक्चर के इर्द-गिर्द हार्डवेयर को सह-डिज़ाइन (co-designing) करके और भी गहरा है।

बेशक, जोखिम कठोरता (rigidity) का है। यदि Gemini का आर्किटेक्चर ऐसी दिशा में विकसित होता है जिसे हार्डकोडेड सर्किट नहीं अपना सकते, तो Google के पास ऐसा महंगा सिलिकॉन हो सकता है जो उसके नए विचारों को नहीं चला पाएगा। यही कारण है कि केवल आर्किटेक्चर वाला समझौता महत्वपूर्ण है। यह एक मध्यम मार्ग प्रदान करता है: नाटकीय दक्षता लाभ प्राप्त करने के लिए पर्याप्त विशेषज्ञता, और कंपनी को किसी कठिन स्थिति में फंसने से बचाने के लिए पर्याप्त लचीलापन।

असली निष्कर्ष

Frozen v2 को एक चिप घोषणा के रूप में नहीं, बल्कि AI प्रतिस्पर्धा के भविष्य के स्वरूप पर एक रणनीतिक दांव के रूप में समझा जाना चाहिए। Google यह दांव लगा रहा है कि विजेता केवल सबसे अच्छे मॉडल ही नहीं बनाएंगे, बल्कि वे पूरे स्टैक (stack) के मालिक होंगे—मॉडल के ब्लूप्रिंट से लेकर ट्रांजिस्टर के माध्यम से गुजरने वाले इलेक्ट्रॉनों तक। यदि यह प्रोजेक्ट सफल होता है, तो इसका लाभ बेंचमार्क स्कोर में नहीं दिखेगा। यह तिमाही अर्निंग रिपोर्ट के लागत कॉलम (cost column) में दिखाई देगा, जहाँ प्रति मिलियन टोकन बचाए गए कुछ सेंट्स जनरेटिव AI में व्यावसायिक रूप से जो संभव है, उसकी सीमाओं को फिर से परिभाषित कर सकते हैं।