Nemotron 3 Nano 30B A3B, దీని పూర్వ రూపం, ఇప్పటికే పెద్ద ఫౌండేషన్ మోడళ్లకు ఒక కాంపాక్ట్ ప్రత్యామ్నాయంగా నిలిచింది. హైబ్రిడ్ Mamba-Transformer ఆర్కిటెక్చర్కు మారడం మరియు ఏ సమయంలోనైనా కేవలం 3.6 బిలియన్ పారామీటర్లను మాత్రమే యాక్టివేట్ చేయడం ద్వారా, Lightning సామర్థ్య పరిధిని పెంచుతూనే, చాలా పెద్ద మోడళ్లకు సమానమైన రీజనింగ్ సామర్థ్యాన్ని అందిస్తోంది.
ఇప్పుడు వేగం ఎందుకు ముఖ్యం
AI ఏజెంట్లు బ్యాచ్-స్టైల్ ఇన్ఫరెన్స్ నుండి నిరంతర ఇంటరాక్షన్ (continuous interaction) వైపు మళ్లుతున్నాయి. కొన్ని సెకన్ల పాటు ఆగిపోయే చాట్బాట్ మందగించినట్లు అనిపిస్తుంది; డెవలపర్ టైపింగ్ వెనుక వెనుకబడే కోడ్-కంప్లీషన్ టూల్ వర్క్ఫ్లోను దెబ్బతీస్తుంది. అటువంటి సందర్భాలలో, సెకనుకు ఎన్ని టోకెన్లు (token-per-second throughput) అనే అంశం నేరుగా స్పందన సామర్థ్యంపై (responsiveness) ప్రభావం చూపుతుంది. 670-tokens-per-second అనే ఈ గణాంకం Google యొక్క Gemini 3.5 Flash-Lite కి నివేదించబడిన 386 tokens per second కంటే దాదాపు రెట్టింపు, మరియు ఇది ఒక ప్రామాణిక Intelligence Index టాస్క్ను పూర్తి చేసే సమయాన్ని సుమారు అర నిమిషానికి తగ్గిస్తుంది. దీనికి విరుద్ధంగా, అదే టాస్క్ కోసం Qwen 3.6 35B A3B కి 3.5 నిమిషాలు మరియు Gemma 4 31B కి 5.8 నిమిషాలు పడుతుంది.
అనేక ఏకకాల అభ్యర్థనలను (simultaneous requests) నిర్వహించాల్సిన ఏ సేవకైనా ఈ వ్యత్యాసం చాలా ముఖ్యం. ఒకే హార్డ్వేర్పై రెట్టింపు టోకెన్లను ప్రాసెస్ చేసే సర్వర్, ఖర్చులను తగ్గించవచ్చు లేదా సామర్థ్యాన్ని రెట్టింపు చేయవచ్చు, ఇది క్లౌడ్ ప్రొవైడర్లకు మరియు ఎంటర్ప్రైజ్ సంస్థలకు స్పష్టమైన ప్రయోజనం.
ఈ మోడల్ ఈ గణాంకాలను ఎలా సాధిస్తుంది
Nemotron 3.5 Lightning యొక్క హైబ్రిడ్ ఆర్కిటెక్చర్, Transformers యొక్క లాంగ్-రేంజ్ ప్యాటర్న్-రికగ్నిషన్ బలాన్ని మరియు Mamba బ్లాక్ల స్టేట్-స్పేస్ సామర్థ్యాన్ని మిళితం చేస్తుంది. మోడలింగ్ సామర్థ్యాన్ని నిలుపుకోవడానికి ఈ డిజైన్ మొత్తం పారామీటర్ల సంఖ్యను 31.6 బిలియన్లుగా ఉంచుతుంది, కానీ ఏదైనా నిర్దిష్ట టోకెన్ కోసం కేవలం 3.6 బిలియన్లు మాత్రమే యాక్టివ్గా ఉంటాయి. స్పార్స్ యాక్టివేషన్ (Sparse activation) ప్రతి టోకెన్కు అయ్యే కంప్యూట్ శ్రమను తగ్గిస్తుంది, తద్వారా నాణ్యతలో పెద్దగా నష్టం లేకుండా త్రూపుట్ను పెంచుతుంది.
Artificial Analysis, Lightning కోసం 24 పాయింట్ల Intelligence Index స్కోరును కొలవగా, ఇది అంతకుముందు ఉన్న Nano మోడల్ సాధించిన 15 పాయింట్ల కంటే తొమ్మిది పాయింట్ల పెరుగుదల. ఇది OpenAI యొక్క gpt-oss-120b కి సమానంగా ఉంది, అయినప్పటికీ Lightning దాదాపు పావు వంతు పారామీటర్లను మాత్రమే ఉపయోగిస్తుంది. ఇది ఇంకా టాప్ మోడళ్లకు — Meta యొక్క Muse Glimmer (35) మరియు Qwen 3.6 35B A3B (32) — కొంచెం వెనుకబడి ఉన్నప్పటికీ, దీని ఇంటెలిజెన్స్-టు-పారామీటర్ నిష్పత్తి అత్యుత్తమమైన వాటిలో ఒకటిగా ఉంది.
ఏజెంటిక్ బెంచ్మార్క్లు కూడా ఇదే కథను చెబుతున్నాయి
ఏజెంటిక్ వర్క్లోడ్లు—ప్లానింగ్, టూల్ యూజ్, మల్టీ-స్టెప్ రీజనింగ్—Lightning అత్యుత్తమంగా పనిచేసే చోటు. GDPval-AA v2 బెంచ్మార్క్లో, ఈ మోడల్ 824 Elo రేటింగ్ను సాధించి, 120-బిలియన్-పారామీటర్ల gpt-oss-120b (800) మరియు Nvidia యొక్క సొంత పెద్ద Nemotron 3 Super (698) కంటే మెరుగైన ఫలితాలను ఇచ్చింది. Terminal-Bench v2.1 పరీక్షలో, Lightning యొక్క సక్సెస్ రేటు 7% నుండి 24.3%కి పెరిగింది, ఇది gpt-oss-120b నమోదు చేసిన 26.2% కి చేరువలో ఉంది.
డొమైన్-స్పెసిఫిక్ టాస్క్లపై మోడల్ను ట్యూన్ చేయడానికి CodeRabbit మరియు Harvey వంటి భాగస్వాములతో చేసిన పోస్ట్-ట్రైనింగ్ సహకారాలను Nvidia కొనియాడింది. ఈ మెరుగుదలలు మోడల్ వేగంగా ఉండటమే కాకుండా, ప్రత్యేక వర్క్లోడ్లపై పోటీతత్వాన్ని కూడా కాపాడుతాయి.
లభ్యత మరియు ఆచరణాత్మక అంశాలు
ఈ మోడల్ అనుమతించదగిన OpenMDW-1.1 లైసెన్స్ కింద అందుబాటులో ఉంది, దీని వెయిట్స్ BF16 మరియు NVFP4 ఫార్మాట్లలో ఉన్నాయి. NVFP4 వేరియంట్ నాణ్యతలో కనిష్ట నష్టంతో మోడల్ను మరింత సమర్థవంతంగా ప్యాక్ చేస్తుంది, ఇది ఎడ్జ్ డిప్లాయ్మెంట్లు లేదా తక్కువ ఖర్చుతో కూడిన క్లౌడ్ ఇన్స్టెన్స్ల కోసం ఉపయోగకరమైన ఎంపిక. ఒక మిలియన్-టోకెన్ కాంటెక్స్ట్ విండో ఉండటం వల్ల, మోడల్ డాక్యుమెంట్-లెవల్ అనాలిసిస్ లేదా విస్తృతమైన కోడ్బేస్ల కోసం చాలా పొడవైన ప్రాంప్ట్లను కోల్పోకుండా (truncation లేకుండా) హ్యాండిల్ చేయగలదు.
DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius మరియు Crusoe వంటి ప్రొవైడర్ల వద్ద సర్వర్లెస్ ఇన్ఫరెన్స్ ఇప్పటికే అందుబాటులో ఉంది. డెవలపర్లు సొంత ఇన్ఫ్రాస్ట్రక్చర్ను నిర్మించకుండానే ప్రయోగాలు చేయడం ప్రారంభించవచ్చు, అయితే నిజమైన ఖర్చు-ప్రయోజనం (cost-effectiveness) అనేది ప్రతి ప్లాట్ఫారమ్ ధరలపై ఆధారపడి ఉంటుంది.
ముఖ్య అంశం: Nemotron 3.5 Lightning, 120-బిలియన్-పారామీటర్ సిస్టమ్ల రీజనింగ్ స్థాయిని మ్యాచ్ చేస్తూనే, ప్రముఖ పోటీదారుల కంటే దాదాపు రెట్టింపు టోకెన్ త్రూపుట్ను అందించగలదని నిరూపించింది, ఇది లేటెన్సీ-సెన్సిటివ్ AI ఏజెంట్లకు ఒక బలమైన అభ్యర్థిగా నిలుస్తుంది.
