DeepMind ने या आठवड्यात DiffusionGemma सादर केले, जे एक ओपन-वेट लँग्वेज मॉडेल आहे जे एका सिंगल H100 GPU वर साधारणपणे प्रति सेकंद १,५०० टोकन्स जनरेट करू शकते, तर मानक Gemma 4 मॉडेल प्रति सेकंद ३०३ टोकन्सच्या जवळ पोहोचते. ही वेगवान वाढ महत्त्वाची आहे कारण यामुळे रिअल-टाइम ॲप्लिकेशन्समध्ये AI-चालित एजंट्सना मंदावणाऱ्या लॅटन्सी (latency) च्या अडथळ्यावर मात करता येईल.
DiffusionGemma 'टोकन-बाय-टोकन' पद्धत कशी बदलतो
बहुतेक आधुनिक लँग्वेज मॉडेल्स ऑटोरेग्रेसिव्ह (autoregressively) पद्धतीने मजकूर तयार करतात: ते एक टोकन प्रेडिक्ट करतात, ते पुन्हा मॉडेलमध्ये फीड करतात आणि मग पुढचे टोकन प्रेडिक्ट करतात. ही "डावीकडून-उजवीकडे" जाणारी लूप प्रक्रिया कॉम्प्युट आणि मेमरी यांच्यात घट्ट संबंध निर्माण करते, कारण प्रत्येक टोकनसाठी मॉडेलचे वेट्स (weights) वापरावे लागतात. DiffusionGemma या लूपच्या जागी एक डिस्क्रीट डिफ्यूजन प्रोसेस (discrete diffusion process) वापरते, जी २५६-टोकनचा संच (chunk) डेटाचा एक मोठा ब्लॉक म्हणून हाताळते. त्यानंतर मॉडेल संपूर्ण ब्लॉक समांतरपणे (in parallel) डिनॉईज (denoises) करते, ज्यामुळे कामाचा भार वारंवार वेट्स शोधण्याऐवजी प्रति स्टेप अधिक कॉम्प्युटवर वळवला जातो. Nvidia च्या H100 सारख्या हार्डवेअरवर, जे समांतर गणितासाठी (parallel math) उत्कृष्ट आहे, तिथे हा बदल फायदेशीर ठरतो.
AI एजंट्ससाठी वेग का महत्त्वाचा आहे
स्वायत्त एजंट्स (Autonomous agents) सहसा शोधणे, सारांश काढणे आणि चाचणी करणे अशा चक्रावर चालतात. प्रत्येक टप्प्यात मॉडेलचे अनेक कॉल्स असू शकतात, त्यामुळे प्रति-टोकन लॅटन्सी वेगाने वाढते. जेव्हा मॉडेल थांबते (stalls), तेव्हा संपूर्ण एजंट पाइपलाइनमध्ये अडथळा निर्माण होतो, ज्यामुळे खर्च वाढतो आणि वापरकर्त्याचा अनुभव खालावतो.
कार्यक्षमतेचा तडजोड (Performance trade-off)
DiffusionGemma चा वेग मूळ क्षमतेमध्ये मोजण्यायोग्य तडजोड करून मिळवला जातो. AIME बेंचमार्कमध्ये—जे तर्कशक्ती (reasoning), तथ्यात्मकता (factuality) आणि भाषा समजून घेण्याची क्षमता मोजते—DiffusionGemma ६९.१ गुण मिळवते, तर Gemma 4 ८८.३ पर्यंत पोहोचते. डिफ्यूजन पद्धतीमध्ये अतिशय लहान आउटपुट आणि अधूनमधून होणारी टोकन "स्टटरिंग" (stuttering) - जिथे तयार झालेला मजकूर पुन्हा पुन्हा येतो किंवा अडखळतो - यांसारख्या उणिवा देखील दिसून येतात. जेव्हा एकाच वेळी ३२ पेक्षा जास्त वापरकर्ते मॉडेलला क्वेरी करतात, तेव्हा समांतरतेचा फायदा कमी होतो आणि मानक ऑटोरेग्रेसिव्ह पद्धत एकूण थ्रूपुटमध्ये (throughput) बरोबरी करते.
प्रत्येक पद्धत कुठे योग्य ठरते
डेटा एका हायब्रिड डिप्लॉयमेंट स्ट्रॅटेजीचा (hybrid deployment strategy) सुझाव देतो:
- Diffusion models: कमी कॉनकरन्सी (low-concurrency) आणि लॅटन्सी-संवेदनशील कामांसाठी जे खोलवर तर्कशक्तीची मागणी करत नाहीत—उदा. लहान प्रॉम्प्ट्स तयार करणे, टेम्प्लेट्स भरणे किंवा मसुदा मजकूर तयार करणे.
- Autoregressive models: उच्च कॉनकरन्सी वर्कलोड्स, जटिल तर्कशक्ती किंवा दीर्घ मजकूर निर्मितीसाठी, जिथे अचूकता वेगापेक्षा जास्त महत्त्वाची असते.
या बदलाचा AI इन्फ्रास्ट्रक्चरसाठी काय अर्थ आहे
जर मॉडेलचा आकार वाढवण्याऐवजी जनरेशन अल्गोरिदमवर पुनर्विचार करून वेगाचा फायदा घेता येत असेल, तर कार्यक्षमतेतील सर्वात मोठे विजय "प्लंबिंग" (plumbing) सुधारणांमधून मिळू शकतात. या तडजोडीचा अर्थ असा देखील आहे की डेव्हलपर्सना काही विशिष्ट वापरांसाठी गुणवत्तेतील किरकोळ घट स्वीकारणे आवश्यक आहे.
प्रतिवाद: डिफ्यूजन मुख्य प्रवाहात येण्यासाठी तयार आहे का?
डिफ्यूजन अंमलबजावणीला लहान प्रॉम्प्ट्ससोबत संघर्ष करावा लागतो आणि त्यातून अस्थिर (jittery) आउटपुट मिळू शकते.
पुढील लक्ष देण्यासारख्या गोष्टी
- Scaling studies: मोठे डिफ्यूजन मॉडेल्स वेग कायम ठेवत क्षमतांमधील अंतर कमी करतील का?
- Hardware optimizations: जसे GPU विकसित होतील, तसे कॉम्प्युट-हेवी डिफ्यूजन स्टेप्स आणि वेट-हेवी ऑटोरेग्रेशनमधील संतुलन पुन्हा बदलू शकते.
- Routing algorithms: टास्क-अवेअर मॉडेल राउटरचे सुरुवातीचे प्रोटोटाइप हे दर्शवतील की डायनॅमिक सिलेक्शनद्वारे एकूण सिस्टम लॅटन्सी किती कमी करता येईल.
निष्कर्ष
DiffusionGemma हे सिद्ध करते की मूलभूत जनरेशन लूपवर पुनर्विचार केल्यास अधिक चिप्स न वापरता लॅटन्सी कमी करता येते. हे तंत्रज्ञान ऑटोरेग्रेसिव्ह मॉडेल्सचा पूर्णपणे पर्याय नाही, परंतु ते हायब्रिड AI स्टॅकसाठी एक प्रभावी साधन आहे जिथे वेग आणि अचूकता कामाच्या स्वरूपानुसार संतुलित केली जाते. AI इन्फ्रास्ट्रक्चरची पुढची लाट केवळ मॉडेलच्या आकारावरून नाही, तर ती कामाचे योग्य इंजिनद्वारे किती हुशारीने राउटिंग करते यावरून ठरवली जाईल.
