त्याचा पूर्ववर्ती, Nemotron 3 Nano 30B A3B, आधीच मोठ्या फाउंडेशन मॉडेल्सना एक संक्षिप्त पर्याय म्हणून ओळखला जात होता. हायब्रीड Mamba-Transformer आर्किटेक्चरचा वापर करून आणि कोणत्याही क्षणी केवळ ३.६ अब्ज पॅरामीटर्स सक्रिय करून, Lightning कार्यक्षमतेच्या कक्षा रुंदावते आणि तरीही मोठ्या मॉडेल्सच्या तोडीची तर्कशक्ती (reasoning power) प्रदान करते.

आता वेग का महत्त्वाचा आहे

AI एजंट्स आता बॅच-स्टाईल इन्फरन्सकडून (batch-style inference) सततच्या संवादाकडे (continuous interaction) वळत आहेत. काही सेकंद थांबणारा चॅटबॉट संथ वाटतो; डेव्हलपरच्या टायपिंगच्या मागे राहणारे कोड-कम्प्लिशन टूल कामाच्या प्रवाहामध्ये अडथळा आणते. अशा परिस्थितीत, 'टोकन-पर-सेकंद थ्रूपुट' (token-per-second throughput) थेट प्रतिसादात्मकतेशी (responsiveness) संबंधित असतो. ६७० टोकन-प्रति-सेकंद हा आकडा Google च्या Gemini 3.5 Flash-Lite साठी नोंदवलेल्या ३८६ टोकन-प्रति-सेकंदच्या तुलनेत साधारण दुप्पट आहे, आणि यामुळे एक मानक Intelligence Index कार्य पूर्ण करण्याचा वेळ सुमारे अर्ध्या मिनिटापर्यंत कमी होतो. याउलट, Qwen 3.6 35B A3B ला त्याच कार्यासाठी ३.५ मिनिटे आणि Gemma 4 31B ला ५.८ मिनिटे लागतात.

एकाच वेळी अनेक विनंत्या (simultaneous requests) हाताळणाऱ्या कोणत्याही सेवेसाठी हा फरक महत्त्वाचा आहे. त्याच हार्डवेअरवर दुप्पट टोकन्स प्रोसेस करणारा सर्व्हर एकतर खर्च कमी करू शकतो किंवा क्षमता दुप्पट करू शकतो, जो क्लाउड प्रदाते आणि उद्योगांसाठी एक स्पष्ट फायदा आहे.

हे मॉडेल हे आकडे कसे साध्य करते

Nemotron 3.5 Lightning चे हायब्रीड आर्किटेक्चर Transformers ची लांब पल्ल्याची पॅटर्न-रेकग्निशन क्षमता आणि Mamba ब्लॉक्सची स्टेट-स्पेस कार्यक्षमता यांचा मेळ घालते. मॉडेलिंग क्षमता टिकवून ठेवण्यासाठी हे डिझाइन एकूण पॅरामीटर संख्या ३१.६ अब्ज इतकी उच्च ठेवते, परंतु कोणत्याही विशिष्ट टोकनसाठी केवळ ३.६ अब्ज पॅरामीटर्स सक्रिय असतात. 'स्पार्स ॲक्टिव्हेशन' (Sparse activation) मुळे प्रति टोकन लागणारी गणना (compute) कमी होते, ज्यामुळे गुणवत्तेत लक्षणीय घट न होता थ्रूपुट वाढतो.

Artificial Analysis ने Lightning साठी २४ चा Intelligence Index स्कोअर मोजला आहे, जो पूर्वीच्या Nano मॉडेलच्या १५ स्कोअरपेक्षा नऊ अंकांची वाढ आहे. यामुळे ते OpenAI च्या gpt-oss-120b च्या बरोबरीचे ठरते, जरी Lightning साधारणपणे त्याच्या एक चतुर्थांश पॅरामीटर्सचा वापर करते. हे अजूनही सर्वोत्तम मॉडेल्स—Meta चे Muse Glimmer (३५) आणि Qwen 3.6 35B A3B (३२)—च्या मागे आहे, परंतु त्याचे 'इंटेलिजन्स-टू-पॅरामीटर रेशो' (intelligence-to-parameter ratio) सर्वोत्तम श्रेणीत आहे.

एजेंटिक बेंचमार्क्स देखील अशीच गोष्ट सांगतात

एजेंटिक वर्कलोड्स—नियोजन (planning), टूलचा वापर (tool use), बहु-स्तरीय तर्क (multi-step reasoning)—यामध्ये Lightning उत्तम कामगिरी करते. GDPval-AA v2 बेंचमार्कवर, मॉडेलने ८२४ चा Elo रेटिंग मिळवले, जे १२०-अब्ज पॅरामीटर असलेल्या gpt-oss-120b (८००) आणि Nvidia च्या स्वतःच्या मोठ्या Nemotron 3 Super (६९८) पेक्षा जास्त आहे. Terminal-Bench v2.1 चाचणीत, Lightning चा यश दर ७ % वरून २४.३ % पर्यंत वाढला, जो gpt-oss-120b ने नोंदवलेल्या २६.२ % च्या जवळ पोहोचला आहे.

डोमेन-विशिष्ट कार्यांसाठी मॉडेल ट्यून करण्यासाठी Nvidia ने CodeRabbit आणि Harvey सारख्या भागीदारांसोबतच्या पोस्ट-ट्रेनिंग सहकार्यांचे श्रेय दिले आहे. या सुधारणांमुळे मॉडेल वेगाने काम करते आणि विशेष वर्कलोड्सवर स्पर्धात्मक राहते.

उपलब्धता आणि व्यावहारिक बाबी

हे मॉडेल उदार (permissive) OpenMDW-1.1 लायसन्स अंतर्गत उपलब्ध आहे, ज्यामध्ये BF16 आणि NVFP4 फॉरमॅटमध्ये वेट्स (weights) उपलब्ध आहेत. NVFP4 व्हेरिएंट गुणवत्तेत किमान घट करून मॉडेल अधिक सुटसुटीत (tightly) पॅक करते, जो एज डिप्लॉयमेंट (edge deployments) किंवा खर्च-जाणीव असलेल्या क्लाउड इन्स्टन्ससाठी एक उपयुक्त पर्याय आहे. १० लाख टोकन्सची कॉन्टेक्स्ट विंडो (context window) मॉडेलला कोणत्याही माहितीचा अपूर्ण भाग न करता (without truncation) अत्यंत लांब प्रॉम्प्ट्स हाताळण्यास सक्षम करते, जे डॉक्युमेंट-स्तरीय विश्लेषण किंवा मोठ्या कोडबेससाठी मौल्यवान आहे.

सर्व्हरलेस इन्फरन्स (Serverless inference) आधीच DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius आणि Crusoe सारख्या प्रदात्यांवर उपलब्ध आहे. डेव्हलपर्स स्वतःची इन्फ्रास्ट्रक्चर उभारण्याशिवाय प्रयोग सुरू करू शकतात, जरी खरी किफायतशीरता प्रत्येक प्लॅटफॉर्मच्या किंमतीवर अवलंबून असेल.

थोडक्यात: Nemotron 3.5 Lightning हे सिद्ध करते की एखादे मॉडेल १२०-अब्ज पॅरामीटर असलेल्या सिस्टम्सच्या तर्कशक्तीशी (reasoning level) जुळवून घेऊ शकते आणि त्याच वेळी आघाडीच्या स्पर्धकांच्या तुलनेत जवळपास दुप्पट टोकन थ्रूपुट देऊ शकते, ज्यामुळे ते लेटन्सी-संवेदनशील (latency-sensitive) AI एजंट्ससाठी एक मजबूत पर्याय ठरते.