DeepMind ने इस सप्ताह DiffusionGemma का अनावरण किया, जो एक ओपन-वेट लैंग्वेज मॉडल है जो एक सिंगल H100 GPU पर लगभग 1,500 टोकन प्रति सेकंड जेनरेट कर सकता है, जबकि स्टैंडर्ड Gemma 4 मॉडल 303 टोकन प्रति सेकंड के करीब तक पहुँचता है। यह स्पीड बूस्ट महत्वपूर्ण है क्योंकि यह उस लेटेंसी बॉटलनेक (latency bottleneck) को कम कर सकता है जो रियल-टाइम एप्लिकेशन्स में AI-संचालित एजेंट्स की गति को धीमा कर देता है।

DiffusionGemma कैसे टोकन-दर-टोकन की आदत को तोड़ता है

अधिकांश आधुनिक लैंग्वेज मॉडल ऑटोरेग्रेसिव (autoregressively) तरीके से टेक्स्ट जेनरेट करते हैं: वे एक टोकन का अनुमान लगाते हैं, उसे वापस मॉडल में फीड करते हैं, और फिर अगले टोकन का अनुमान लगाते हैं। यह "बाएं-से-दाएं" वाला लूप कंप्यूट और मेमोरी के बीच एक गहरा संबंध (tight coupling) बनाता है, क्योंकि हर एक टोकन के लिए मॉडल के वेट्स (weights) तक पहुंचना आवश्यक होता है। DiffusionGemma इस लूप को एक डिस्क्रीट डिफ्यूजन प्रोसेस (discrete diffusion process) से बदल देता है जो 256-टोकन के एक चंक को शोर वाले डेटा (noisy data) के एक सिंगल ब्लॉक के रूप में मानता है। इसके बाद मॉडल पूरे ब्लॉक को पैरेलल (parallel) में डिनोइज़ (denoises) करता है, जिससे वर्कलोड बार-बार वेट लुकअप करने के बजाय प्रति स्टेप अधिक कंप्यूट की ओर स्थानांतरित हो जाता है। Nvidia के H100 जैसे हार्डवेयर पर, जो पैरेलल मैथ (parallel math) में उत्कृष्ट है, यह ट्रेड-ऑफ फायदेमंद साबित होता है।

AI एजेंट्स के लिए स्पीड क्यों मायने रखती है

स्वायत्त (Autonomous) एजेंट्स आमतौर पर सर्चिंग, समराइजिंग और टेस्टिंग का एक चक्र चलाते हैं। प्रत्येक चरण में कई मॉडल कॉल्स शामिल हो सकते हैं, इसलिए प्रति-टोकन लेटेंसी बहुत तेज़ी से बढ़ती है। जब कोई मॉडल रुकता है, तो पूरा एजेंट पाइपलाइन पीछे रह जाता है, जिससे लागत बढ़ती है और यूजर एक्सपीरियंस खराब होता है।

परफॉरमेंस ट्रेड-ऑफ

DiffusionGemma की स्पीड की कीमत उसकी रॉ कैपेबिलिटी (raw capability) में मापने योग्य कमी के रूप में चुकानी पड़ती है। AIME बेंचमार्क में—जो रीजनिंग, फैक्टुअलिटी और लैंग्वेज अंडरस्टैंडिंग को मापता है—DiffusionGemma का स्कोर 69.1 है, जबकि Gemma 4 का स्कोर 88.3 तक पहुँचता है। डिफ्यूजन अप्रोच बहुत छोटे आउटपुट के साथ कमज़ोरियाँ भी दिखाता है और कभी-कभी टोकन "स्टटरिंग" (stuttering) की समस्या होती है, जहाँ जेनरेट किया गया टेक्स्ट दोहराया जाता है या हिचकिचाता है। जब एक साथ लगभग 32 से अधिक यूजर्स मॉडल को क्वेरी करते हैं, तो पैरेलल एडवांटेज कम हो जाता है और स्टैंडर्ड ऑटोरेग्रेसिव मेथड ओवरऑल थ्रूपुट में बराबरी कर लेता है।

प्रत्येक अप्रोच कहाँ फिट बैठती है

डेटा एक हाइब्रिड डिप्लॉयमेंट रणनीति का सुझाव देता है:

  • डिफ्यूजन मॉडल्स: कम-कन्करेंसी (low-concurrency) वाले, लेटेंसी-सेंसिटिव कार्यों के लिए जिनमें गहरी रीजनिंग की आवश्यकता नहीं होती—जैसे कि छोटे प्रॉम्प्ट जेनरेट करना, टेम्पलेट्स भरना, या ड्राफ्ट टेक्स्ट तैयार करना।
  • ऑटोरेग्रेसिव मॉडल्स: हाई-कन्करेंसी वर्कलोड, जटिल रीजनिंग, या लॉन्ग-फॉर्म जनरेशन के लिए जहाँ सटीकता (accuracy) रॉ स्पीड से अधिक महत्वपूर्ण है।

इस बदलाव का AI इंफ्रास्ट्रक्चर के लिए क्या अर्थ है

यदि केवल मॉडल का आकार बढ़ाकर नहीं, बल्कि जनरेशन एल्गोरिदम पर पुनर्विचार करके स्पीड हासिल की जा सकती है, तो दक्षता (efficiency) की सबसे बड़ी जीत "प्लंबिंग" (plumbing) सुधारों से आ सकती है। इस ट्रेड-ऑफ का मतलब यह भी है कि डेवलपर्स को कुछ उपयोग के मामलों (use cases) के लिए क्वालिटी में मामूली गिरावट स्वीकार करनी होगी।

काउंटरपॉइंट: क्या डिफ्यूजन प्राइम टाइम के लिए तैयार है?

डिफ्यूजन इम्प्लीमेंटेशन छोटे प्रॉम्प्ट्स के साथ संघर्ष करता है और अस्थिर (jittery) आउटपुट दे सकता है।

आगे क्या देखने लायक है

  • स्केलिंग स्टडीज: क्या बड़े डिफ्यूजन मॉडल्स स्पीड बनाए रखते हुए कैपेबिलिटी गैप को कम कर पाएंगे?
  • हार्डवेयर ऑप्टिमाइज़ेशन: जैसे-जैसे GPUs विकसित होंगे, कंप्यूट-हैवी डिफ्यूजन स्टेप्स और वेट-हैवी ऑटोरेग्रेशन के बीच का संतुलन फिर से बदल सकता है।
  • रूटिंग एल्गोरिदम: टास्क-अवेयर मॉडल राउटर के शुरुआती प्रोटोटाइप यह दिखाएंगे कि डायनेमिक सिलेक्शन के माध्यम से ओवरऑल सिस्टम लेटेंसी को कितना कम किया जा सकता है।

निष्कर्ष

DiffusionGemma यह साबित करता है कि अधिक चिप्स जोड़े बिना, फंडामेंटल जनरेशन लूप पर पुनर्विचार करके लेटेंसी को काफी कम किया जा सकता है। यह तकनीक ऑटोरेग्रेसिव मॉडल्स का पूर्ण प्रतिस्थापन (wholesale replacement) नहीं है, बल्कि यह एक हाइब्रिड AI स्टैक के लिए एक सम्मोहक टूल प्रदान करती है जहाँ स्पीड और सटीकता को प्रति-कार्य (per-task) आधार पर संतुलित किया जाता है। AI इंफ्रास्ट्रक्चर की अगली लहर का मूल्यांकन केवल मॉडल के आकार से नहीं, बल्कि इस बात से किया जाएगा कि वह काम को सही तरह के इंजन के माध्यम से कितनी चतुराई से रूट करता है।