इसका पूर्ववर्ती, Nemotron 3 Nano 30B A3B, पहले से ही बड़े फाउंडेशन मॉडल्स के एक कॉम्पैक्ट विकल्प के रूप में स्थापित था। हाइब्रिड Mamba-Transformer आर्किटेक्चर को अपनाकर और किसी भी समय केवल 3.6 बिलियन पैरामीटर्स को सक्रिय करके, Lightning दक्षता की सीमाओं को आगे बढ़ाता है, जबकि यह बहुत बड़े मॉडल्स के समान रीजनिंग पावर भी प्रदान करता है।
अब गति क्यों महत्वपूर्ण है
AI एजेंट्स बैच-स्टाइल इन्फरेंस से निरंतर इंटरैक्शन की ओर बढ़ रहे हैं। एक चैटबॉट जो कई सेकंड के लिए रुक जाता है, वह सुस्त महसूस होता है; एक कोड-कम्प्लीशन टूल जो डेवलपर की टाइपिंग से पीछे रह जाता है, वर्कफ़्लो को बाधित करता है। ऐसे परिवेश में, टोकन-प्रति-सेकंड थ्रूपुट सीधे तौर पर महसूस की जाने वाली प्रतिक्रियाशीलता (responsiveness) में बदल जाता है। 670-टोकन-प्रति-सेकंड का आंकड़ा Google के Gemini 3.5 Flash-Lite के लिए रिपोर्ट किए गए 386 टोकन प्रति सेकंड से लगभग दोगुना है, और यह एक मानक Intelligence Index कार्य को पूरा करने के समय को घटाकर लगभग आधा मिनट कर देता है। इसके विपरीत, उसी कार्य के लिए Qwen 3.6 35B A3B को 3.5 मिनट और Gemma 4 31B को 5.8 मिनट की आवश्यकता होती है।
यह अंतर किसी भी ऐसी सेवा के लिए महत्वपूर्ण है जिसे कई एक साथ (simultaneous) आने वाली रिक्वेस्ट को संभालना होता है। एक सर्वर जो उसी हार्डवेयर पर दोगुने टोकन प्रोसेस कर सकता है, वह या तो लागत कम कर सकता है या क्षमता को दोगुना कर सकता है, जो क्लाउड प्रदाताओं और उद्यमों के लिए एक स्पष्ट लाभ है।
मॉडल अपने ये आंकड़े कैसे हासिल करता है
Nemotron 3.5 Lightning का हाइब्रिड आर्किटेक्चर Transformers की लॉन्ग-रेंज पैटर्न-रिकग्निशन क्षमताओं को Mamba ब्लॉक्स की स्टेट-स्पेस दक्षता के साथ जोड़ता है। यह डिज़ाइन मॉडलिंग क्षमता बनाए रखने के लिए कुल पैरामीटर काउंट को उच्च—31.6 बिलियन—रखता है, लेकिन किसी भी दिए गए टोकन के लिए केवल 3.6 बिलियन ही सक्रिय होते हैं। स्पार्स एक्टिवेशन (Sparse activation) प्रति टोकन कंप्यूट को कम करता है, जिससे गुणवत्ता में आनुपातिक कमी के बिना थ्रूपुट बढ़ जाता है।
Artificial Analysis ने Lightning के लिए 24 का Intelligence Index स्कोर मापा, जो पिछले Nano मॉडल द्वारा प्राप्त 15 के स्कोर से नौ अंकों की छलांग है। यह इसे OpenAI के gpt-oss-120b के बराबर खड़ा करता है, भले ही Lightning लगभग एक चौथाई पैरामीटर्स का ही उपयोग करता है। यह अभी भी शीर्ष मॉडल्स—Meta के Muse Glimmer (35) और Qwen 3.6 35B A3B (32)—से पीछे है, लेकिन इसका इंटेलिजेंस-टू-पैरामीटर अनुपात सबसे अच्छे रैंकों में से एक है।
एजेंटिक बेंचमार्क भी ऐसी ही कहानी बताते हैं
एजेंटिक वर्कलोड—प्लानिंग, टूल का उपयोग, मल्टी-स्टेप रीजनिंग—वे क्षेत्र हैं जहाँ Lightning चमकता है। GDPval-AA v2 बेंचमार्क पर, मॉडल ने 824 की Elo रेटिंग हासिल की, जो 120-बिलियन-पैरामीटर वाले gpt-oss-120b (800) और Nvidia के अपने बड़े Nemotron 3 Super (698) से आगे है। Terminal-Bench v2.1 टेस्ट में, Lightning की सफलता दर 7% से बढ़कर 24.3% हो गई, जो gpt-oss-120b द्वारा दर्ज किए गए 26.2% के करीब पहुँच गई है।
Nvidia ने डोमेन-विशिष्ट कार्यों पर मॉडल को ट्यून करने के लिए CodeRabbit और Harvey जैसे पार्टनर्स के साथ पोस्ट-ट्रेनिंग सहयोग का श्रेय दिया है। ये सुधार मॉडल को तेज़ रखते हैं और साथ ही विशेष वर्कलोड पर प्रतिस्पर्धी बनाए रखते हैं।
उपलब्धता और व्यावहारिक विचार
यह मॉडल परमिटिव OpenMDW-1.1 लाइसेंस के तहत उपलब्ध है, जिसके वेट्स BF16 और NVFP4 फॉर्मेट में हैं। NVFP4 वेरिएंट न्यूनतम गुणवत्ता हानि के साथ मॉडल को अधिक सघनता से पैक करता है, जो एज डिप्लॉयमेंट या लागत के प्रति सचेत क्लाउड इंस्टेंस के लिए एक उपयोगी विकल्प है। एक मिलियन-टोकन का कॉन्टेक्स्ट विंडो मॉडल को बिना ट्रंकेशन के बहुत लंबे प्रॉम्प्ट्स को संभालने की अनुमति देता है, जो डॉक्यूमेंट-लेवल विश्लेषण या विस्तृत कोडबेस के लिए मूल्यवान है।
सर्वरलेस इन्फरेंस पहले से ही DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius और Crusoe जैसे प्रदाताओं पर चल रहा है। डेवलपर्स कस्टम इंफ्रास्ट्रक्चर बनाए बिना प्रयोग करना शुरू कर सकते हैं, हालांकि वास्तविक लागत-प्रभावशीलता प्रत्येक प्लेटफॉर्म की प्राइसिंग पर निर्भर करेगी।
निष्कर्ष: Nemotron 3.5 Lightning यह साबित करता है कि एक मॉडल 120-बिलियन-पैरामीटर सिस्टम के रीजनिंग स्तर का मुकाबला कर सकता है और साथ ही अग्रणी प्रतिस्पर्धियों की तुलना में लगभग दोगुना टोकन थ्रूपुट प्रदान कर सकता है, जो इसे लेटेंसी-सेंसिटिव AI एजेंट्स के लिए एक मजबूत दावेदार बनाता है।
