இதற்கு முந்தைய மாடலான Nemotron 3 Nano 30B A3B, ஏற்கனவே பெரிய foundation models-களுக்கு ஒரு சுருக்கமான மாற்றாக (compact alternative) முன்வைக்கப்பட்டிருந்தது. Mamba-Transformer hybrid architecture-க்கு மாறுவதன் மூலமும், எந்தவொரு நேரத்திலும் 3.6 பில்லியன் parameters-களை மட்டும் செயல்படுத்துவதன் மூலமும், Lightning அதன் செயல்திறன் எல்லையை (efficiency frontier) விரிவுபடுத்துகிறது; அதே சமயம் மிகப்பெரிய மாடல்களுக்கு இணையான reasoning power-ஐயும் வழங்குகிறது.
இப்போது வேகம் ஏன் முக்கியமானது
AI agents இப்போது batch-style inference முறையிலிருந்து தொடர்ச்சியான உரையாடல் (continuous interaction) முறைக்கு மாறி வருகின்றன. சில வினாடிகள் தயங்கும் ஒரு chatbot மந்தமாகத் தோன்றும்; ஒரு developer தட்டச்சு செய்வதைத் தொடர்ந்து வராத code-completion கருவி, பணி ஓட்டத்தை (workflow) பாதிக்கும். அத்தகைய சூழல்களில், token-per-second throughput என்பது நேரடியாகப் பயனரால் உணரப்படும் பதிலளிக்கும் திறனாக (responsiveness) மாறுகிறது. 670-token-per-second என்ற இந்த அளவு, Google-இன் Gemini 3.5 Flash-Lite-க்குக் கூறப்பட்ட 386 tokens per second-ஐ விட ஏறத்தாழ இருமடங்கு ஆகும்; மேலும் இது ஒரு நிலையான Intelligence Index பணியை முடிக்க எடுக்கும் நேரத்தை சுமார் அரை நிமிடமாகக் குறைக்கிறது. இதற்கு நேர்மாறாக, அதே பணிக்கு Qwen 3.6 35B A3B மாடலுக்கு 3.5 நிமிடங்களும், Gemma 4 31B மாடலுக்கு 5.8 நிமிடங்களும் தேவைப்படுகின்றன.
ஒரே நேரத்தில் பல கோரிக்கைகளை (simultaneous requests) கையாள வேண்டிய எந்தவொரு சேவைக்கும் இந்த இடைவெளி முக்கியமானது. ஒரே வன்பொருளில் (hardware) இரண்டு மடங்கு அதிக tokens-களைச் செயலாக்கும் ஒரு server, செலவைக் குறைக்கலாம் அல்லது கொள்ளளவை (capacity) இரட்டிப்பாக்கலாம்; இது cloud providers மற்றும் நிறுவனங்களுக்கு (enterprises) ஒரு தெளிவான நன்மையாகும்.
இந்த மாடல் தனது எண்களை எவ்வாறு எட்டுகிறது
Nemotron 3.5 Lightning-இன் hybrid architecture, Transformers-இன் நீண்ட தூர pattern-recognition திறனையும், Mamba blocks-இன் state-space செயல்திறனையும் ஒருங்கிணைக்கிறது. இந்த வடிவமைப்பு, modeling capacity-ஐத் தக்கவைக்க மொத்த parameter எண்ணிக்கையை 31.6 பில்லியன் என்ற அளவில் உயர்வாக வைத்திருக்கிறது, ஆனால் ஒரு குறிப்பிட்ட token-க்கு 3.6 பில்லியன் மட்டுமே செயல்படுகின்றன. Sparse activation முறையில், ஒரு token-க்கான கணக்கீட்டுத் திறன் (compute per token) குறைக்கப்படுவதால், தரத்தில் பெரிய இழப்பு இல்லாமல் throughput அதிகரிக்கிறது.
Artificial Analysis நிறுவனம் Lightning-க்கு 24 Intelligence Index மதிப்பெண்ணை அளவிட்டுள்ளது, இது முந்தைய Nano மாடல் பெற்ற 15 மதிப்பெண்ணை விட ஒன்பது புள்ளிகள் அதிகம். Lightning ஏறத்தாழ கால் பங்கு parameters-களை மட்டுமே பயன்படுத்தினாலும், இது OpenAI-இன் gpt-oss-120b மாடலுக்கு இணையானதாக உள்ளது. இது Meta-இன் Muse Glimmer (35) மற்றும் Qwen 3.6 35B A3B (32) போன்ற முன்னணி மாடல்களை விடப் பின்தங்கியிருந்தாலும், அதன் intelligence-to-parameter விகிதம் மிகச்சிறந்த வரிசையில் உள்ளது.
Agentic benchmarks-களும் இதே கதையைத்தான் சொல்கின்றன
Agentic workloads—திட்டமிடுதல் (planning), கருவிகளைப் பயன்படுத்துதல் (tool use), பல படிநிலைத் தர்க்கம் (multi-step reasoning)—ஆகியவற்றில்தான் Lightning சிறப்பாகச் செயல்படுகிறது. GDPval-AA v2 benchmark-இல், இந்த மாடல் 824 Elo rating-ஐப் பெற்றுள்ளது; இது 120-billion-parameter கொண்ட gpt-oss-120b (800) மற்றும் Nvidia-இன் பெரிய மாடலான Nemotron 3 Super (698)-ஐ விட outperforms செய்கிறது. Terminal-Bench v2.1 சோதனையில், Lightning-இன் வெற்றி விகிதம் 7%-லிருந்து 24.3%-ஆக உயர்ந்து, gpt-oss-120b பதிவு செய்த 26.2%-ஐ நெருங்கியுள்ளது.
குறிப்பிட்ட துறை சார்ந்த பணிகளுக்காக (domain-specific tasks) மாடலைச் செம்மைப்படுத்த (tuning), CodeRabbit மற்றும் Harvey போன்ற கூட்டாளர்களுடனான post-training ஒத்துழைப்பிற்கு Nvidia முக்கியத்துவம் அளித்துள்ளது. இந்தச் செம்மைப்படுத்துதல்கள், மாடலை வேகமாகவும் அதே சமயம் சிறப்புப் பணிகளில் (specialized workloads) போட்டியிடக்கூடியதாகவும் வைத்திருக்கின்றன.
கிடைக்கும் தன்மை மற்றும் நடைமுறைச் சிந்தனைகள்
இந்த மாடல் தாராளமான OpenMDW-1.1 license-இன் கீழ் கிடைக்கிறது, மேலும் இதன் weights BF16 மற்றும் NVFP4 வடிவங்களில் உள்ளன. NVFP4 variant, தரத்தில் மிகக் குறைந்த இழப்புடன் மாடலைச் சுருக்கமான முறையில் வழங்குகிறது; இது edge deployments அல்லது செலவைக் குறைக்க விரும்பும் cloud instances-களுக்கு ஒரு பயனுள்ள விருப்பமாகும். ஒரு மில்லியன்-token context window இருப்பதால், மாடலால் மிக நீண்ட prompts-களைத் துண்டிக்காமல் (truncation) கையாள முடியும்; இது ஆவண அளவிலான பகுப்பாய்வு (document-level analysis) அல்லது விரிவான codebases-களுக்கு மிகவும் பயனுள்ளதாக இருக்கும்.
Serverless inference ஏற்கனவே DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius மற்றும் Crusoe போன்ற வழங்குநர்களிடம் (providers) கிடைக்கிறது. டெவலப்பர்கள் சொந்தமாக உள்கட்டமைப்பை (custom infrastructure) உருவாக்காமலேயே சோதனைகளைத் தொடங்கலாம், இருப்பினும் உண்மையான செலவுத் திறன் (cost-effectiveness) ஒவ்வொரு தளத்தின் விலையைப் பொறுத்தே அமையும்.
முக்கியக் குறிப்பு: 120-billion-parameter அமைப்புகளின் reasoning அளவை ஒரு மாடலால் ஈடுகட்ட முடியும் என்பதையும், அதே சமயம் முன்னணிப் போட்டியாளர்களை விட ஏறத்தாழ இருமடங்கு token throughput-ஐ வழங்க முடியும் என்பதையும் Nemotron 3.5 Lightning நிரூபிக்கிறது; இது latency-sensitive AI agents-களுக்கு ஒரு சிறந்த தேர்வாக அமைகிறது.
