Nvidia ने 11 अगस्त को Nemotron 3.5 Lightning लॉन्च किया। यह 30-बिलियन-पैरामीटर वाला mixture-of-experts मॉडल केवल 3 बिलियन सक्रिय पैरामीटर्स के साथ चलता है, और इसकी सहयोगी NeMo Switchyard राउटिंग लाइब्रेरी ने इन्फरेंस (inference) लागत और कैश दक्षता (cache efficiency) को लेकर पहले ही बहस छेड़ दी है। जिस तरह से Switchyard मॉडलों के बीच अनुरोधों (requests) को इधर-उधर भेजता है, वह प्रॉम्प्ट कैश (prompt caches) को खराब कर सकता है और संभावित रूप से एक एकल इन्फरेंस सत्र के बिल को दोगुना कर सकता है।
ओपन-वेट एजेंटों के लिए बना एक मॉडल
Nemotron 3.5 Lightning उन AI एजेंटों को लक्षित करता है जो टूल्स का उपयोग करते हैं, परिणामों को सत्यापित करते हैं, और रीजनिंग ट्रेस (reasoning trace) बनाए रखते हैं। तीन तकनीकी विकल्प इसे अलग बनाते हैं:
- हाइब्रिड आर्किटेक्चर (Hybrid architecture) – यह एक Mamba-2 स्टेट-स्पेस कोर को पारंपरिक Transformer के साथ जोड़ता है, जिससे यह साबित होता है कि नॉन-Transformer डिज़ाइन भी इस स्तर पर प्रतिस्पर्धा कर सकते हैं।
- 4-बिट फ्लोटिंग-पॉइंट क्वांटाइजेशन (4-bit floating-point quantization) – लो-प्रिसिजन (low-precision) में उपलब्ध होने के कारण, यह 30 B मॉडल M5 Max MacBook Pro पर लगभग 100 टोकन प्रति सेकंड की गति से काम कर सकता है, जो कि एक फुल-प्रिसिजन मॉडल के लिए हासिल करना कठिन होगा।
- पूर्ण खुलापन (Full openness) – Nvidia ने वेट फाइल्स और संपूर्ण ट्रेनिंग रेसिपी जारी की है, जो हाई-परफॉर्मेंस इन्फरेंस के उद्देश्य से बनाए गए मॉडल के लिए एक दुर्लभ बात है।
शुरुआती उपयोगकर्ताओं का कहना है कि मॉडल "ओवर-थिंक" (over-think) कर सकता है, जिससे लंबी रीजनिंग चेन निकलती है जो कभी-कभी गलत हो सकती है। डेवलपर्स को एक शक्तिशाली, खुले तौर पर उपलब्ध एजेंट एक्जीक्यूटर (agent executor) तो मिलता है, लेकिन अनावश्यक विस्तार से बचने के लिए उन्हें सावधानीपूर्वक प्रॉम्प्ट देना होगा।
राउटिंग लेयर क्यों महत्वपूर्ण है
NeMo Switchyard, उम्मीदवारों के समूह में से किसी अनुरोध को "सर्वश्रेष्ठ" मॉडल तक गतिशील रूप से भेजने (dynamically routing) के लिए Nvidia की लाइब्रेरी है। सैद्धांतिक रूप से, एक राउटर प्रत्येक क्वेरी के लिए एक विशेषज्ञ मॉडल चुनकर उत्तर की गुणवत्ता बढ़ा सकता है। व्यवहार में, राउटिंग का निर्णय प्रॉम्प्ट-कैशिंग (prompt-caching) तंत्र के साथ टकराता है, जिस पर कई इन्फरेंस पाइपलाइन निर्भर करती हैं।
- प्रॉम्प्ट कैश (Prompt caches) शुरुआती प्रॉम्प्ट के टोकन एम्बेडिंग (token embeddings) को स्टोर करते हैं ताकि बाद के जनरेशन बिना "प्रीफिल" (prefill) स्टेप को दोबारा कंप्यूट किए उनका पुन: उपयोग कर सकें।
- राउटिंग स्वैप (Routing swaps) पहले कुछ टोकन के बाद अनुरोध को मॉडल A से मॉडल B पर स्थानांतरित कर देते हैं, जिससे सिस्टम को कैश किए गए प्रॉम्प्ट को छोड़ना पड़ता है और नए मॉडल के लिए इसे शुरू से दोबारा कंप्यूट करना पड़ता है।
चूंकि अधिकांश AI खर्च नए टोकन जेनरेट करने के बजाय कैश किए गए प्रॉम्प्ट को पढ़ने में होता है, इसलिए एक एकल राउटिंग हॉप (routing hop) प्रभावी रूप से अनुरोध की लागत को दोगुना कर सकता है।
लागत की खींचतान
भविष्य में क्या है
यह बहस तब शुरू हुई है जब Nvidia की ओपन-वेट रणनीति का सीधा मुकाबला हो रहा है। 15 अगस्त को Qwen 3.8-27B लॉन्च होगा, और शुरुआती बेंचमार्क बताते हैं कि यह स्थानीय विकास परिदृश्यों (local development scenarios) में Nemotron 3.5 Lightning का मुकाबला कर सकता है।
Nvidia का पैटर्न—ओपन वेट्स, ओपन ट्रेनिंग रेसिपी और एक ओपन राउटिंग लेयर—ऐसा लगता है कि इसे इस तरह डिज़ाइन किया गया है कि जो कोई भी इन मॉडलों को स्थानीय रूप से चला रहा है, उसके लिए इसके GPU डिफ़ॉल्ट हार्डवेयर बन जाएं। सॉफ्टवेयर स्टैक को उजागर करके, Nvidia डेवलपर्स को अपने इकोसिस्टम में बांधने की उम्मीद करता है, भले ही राउटिंग लॉजिक से छिपी हुई लागत बढ़ जाए।
निष्कर्ष (Takeaway)
यदि आप अपने स्वयं के मशीन पर Nemotron 3.5 Lightning चलाने की योजना बना रहे हैं, तो केवल यह न पूछें कि "यह कितनी तेज़ी से जेनरेट कर सकता है?" बल्कि यह भी पूछें कि "Switchyard मुझे कितनी बार अपना प्रॉम्प्ट कैश छोड़ने के लिए मजबूर करेगा?" वही उत्तर यह निर्धारित करेगा कि मॉडल का ओपन-वेट वादा वास्तविक दुनिया में बचत बनेगा या एक महंगा प्रयोग। जैसे-जैसे Qwen जैसे विकल्प सामने आ रहे हैं, राउटिंग लचीलेपन और कैश-संचालित लागत दक्षता के बीच का संतुलन यह तय करेगा कि कौन सा टूलकिट—और अंततः कौन सा हार्डवेयर प्लेटफॉर्म—विजेता बनेगा।
