Nemotron 3 Nano 30B A3B, જે તેનો પૂર્વગામી હતો, તેને પહેલેથી જ મોટા ફાઉન્ડેશન મોડલ્સના કોમ્પેક્ટ વિકલ્પ તરીકે જોવામાં આવતો હતો. હાઇબ્રિડ Mamba-Transformer આર્કિટેક્ચરમાં સ્વિચ કરીને અને કોઈપણ સમયે માત્ર 3.6 બિલિયન પેરામીટર્સને સક્રિય કરીને, Lightning કાર્યક્ષમતાની સીમાઓને આગળ ધપાવે છે અને સાથે સાથે ઘણા મોટા મોડલ્સની સમકક્ષ રીઝનિંગ પાવર પણ પ્રદાન કરે છે.

અત્યારે ઝડપ શા માટે મહત્વની છે

AI એજન્ટ્સ બેચ-સ્ટાઇલ ઇન્ફરન્સથી સતત ઇન્ટરેક્શન તરફ આગળ વધી રહ્યા છે. જો ચેટબોટ કેટલાક સેકન્ડ માટે અટકી જાય તો તે ધીમો લાગે છે; જો કોડ-કમ્પ્લીશન ટૂલ ડેવલપરના ટાઇપિંગ કરતા પાછળ રહી જાય તો તે વર્કફ્લોમાં ખલેલ પહોંચાડે છે. આ પ્રકારના સેટિંગ્સમાં, ટોકન-પર-સેકન્ડ થ્રુપુટ સીધી રીતે પ્રતિભાવશીલતા (responsiveness) તરીકે અનુભવાય છે. 670-ટોકન-પર-સેકન્ડનો આ આંકડો Google ના Gemini 3.5 Flash-Lite માટે નોંધાયેલા 386 ટોકન પ્રતિ સેકન્ડ કરતા લગભગ બમણો છે, અને તે સ્ટાન્ડર્ડ Intelligence Index કાર્ય પૂર્ણ કરવાનો સમય ઘટાડીને લગભગ અડધા મિનિટ સુધી લઈ આવે છે. તેની સરખામણીમાં, Qwen 3.6 35B A3B ને તે જ કાર્ય માટે 3.5 મિનિટ અને Gemma 4 31B ને 5.8 મિનિટની જરૂર પડે છે.

જે કોઈપણ સર્વિસ માટે આ તફાવત મહત્વનો છે જેને એકસાથે અનેક વિનંતીઓ (requests) હેન્ડલ કરવી પડે છે. સમાન હાર્ડવેર પર બમણા ટોકન્સ પ્રોસેસ કરતું સર્વર કાં તો ખર્ચ ઘટાડી શકે છે અથવા ક્ષમતા બમણી કરી શકે છે, જે ક્લાઉડ પ્રોવાઇડર્સ અને એન્ટરપ્રાઇઝ માટે સ્પષ્ટ ફાયદો છે.

મોડલ આ આંકડા કેવી રીતે પ્રાપ્ત કરે છે

Nemotron 3.5 Lightning નું હાઇબ્રિડ આર્કિટેક્ચર Transformers ની લોંગ-રેન્જ પેટર્ન-રેકગ્નિશન શક્તિને Mamba બ્લોક્સની સ્ટેટ-સ્પેસ કાર્યક્ષમતા સાથે જોડે છે. આ ડિઝાઇન મોડેલિંગ ક્ષમતા જાળવી રાખવા માટે કુલ પેરામીટર સંખ્યા ઊંચી—31.6 બિલિયન—રાખે છે, પરંતુ કોઈપણ આપેલ ટોકન માટે માત્ર 3.6 બિલિયન જ સક્રિય હોય છે. સ્પાર્સ એક્ટિવેશન (Sparse activation) પ્રતિ ટોકન કમ્પ્યુટ ઘટાડે છે, જેનાથી ગુણવત્તામાં પ્રમાણસર ઘટાડો કર્યા વિના થ્રુપુટ વધે છે.

Artificial Analysis એ Lightning માટે 24 નો Intelligence Index સ્કોર માપ્યો છે, જે અગાઉના Nano મોડલ દ્વારા મેળવેલા 15 સ્કોર કરતા નવ પોઈન્ટનો ઉછાળો છે. આ તેને OpenAI ના gpt-oss-120b ની બરાબરી પર લાવે છે, ભલે Lightning લગભગ ચોથા ભાગના પેરામીટર્સનો ઉપયોગ કરે છે. તે હજુ પણ ટોચના મોડલ્સ—Meta ના Muse Glimmer (35) અને Qwen 3.6 35B A3B (32)—થી પાછળ છે, પરંતુ તેનું ઇન્ટેલિજન્સ-ટુ-પેરામીટર રેશિયો શ્રેષ્ઠમાં સ્થાન ધરાવે છે.

એજન્ટિક બેન્ચમાર્ક પણ સમાન વાર્તા કહે છે

એજન્ટિક વર્કલોડ્સ—પ્લાનિંગ, ટૂલનો ઉપયોગ, મલ્ટી-સ્ટેપ રીઝનિંગ—તે ક્ષેત્રો છે જ્યાં Lightning ચમકે છે. GDPval-AA v2 બેન્ચમાર્ક પર, મોડેલે 824 ની Elo રેટિંગ મેળવી છે, જે 120-બિલિયન-પેરામીટર ધરાવતા gpt-oss-120b (800) અને Nvidia ના પોતાના મોટા Nemotron 3 Super (698) કરતા વધુ છે. Terminal-Bench v2.1 ટેસ્ટમાં, Lightning નો સફળતા દર 7% થી વધીને 24.3% થયો છે, જે gpt-oss-120b દ્વારા નોંધાયેલા 26.2% ની નજીક પહોંચ્યો છે.

Nvidia એ ડોમેન-સ્પેસિફિક કાર્યો પર મોડલને ટ્યુન કરવા માટે CodeRabbit અને Harvey જેવા ભાગીદારો સાથેના પોસ્ટ-ટ્રેનિંગ સહયોગને શ્રેય આપ્યો છે. આ સુધારાઓ મોડલને ઝડપી રાખે છે અને સાથે સાથે વિશિષ્ટ વર્કલોડ્સ પર સ્પર્ધાત્મક પણ બનાવે છે.

ઉપલબ્ધતા અને વ્યવહારિક બાબતો

આ મોડલ પરવાનગી આપતા OpenMDW-1.1 લાયસન્સ હેઠળ ઉપલબ્ધ છે, જેમાં BF16 અને NVFP4 ફોર્મેટમાં વેઇટ્સ (weights) છે. NVFP4 વેરિઅન્ટ ગુણવત્તામાં ન્યૂનતમ ઘટાડા સાથે મોડલને વધુ ટાઈટલી પેક કરે છે, જે એજ ડિપ્લોયમેન્ટ્સ અથવા ખર્ચ-સભાન ક્લાઉડ ઇન્સ્ટન્સ માટે ઉપયોગી વિકલ્પ છે. એક મિલિયન-ટોકન કોન્ટેક્સ્ટ વિન્ડો મોડલને ટ્રંકેશન વગર ખૂબ લાંબા પ્રોમ્પ્ટ્સ હેન્ડલ કરવા દે છે, જે ડોક્યુમેન્ટ-લેવલ એનાલિસિસ અથવા વ્યાપક કોડબેઝ માટે મૂલ્યવાન છે.

સર્વરલેસ ઇન્ફરન્સ પહેલેથી જ DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius અને Crusoe જેવા પ્રોવાઇડર્સ પર ચાલે છે. ડેવલપર્સ કસ્ટમ ઇન્ફ્રાસ્ટ્રક્ચર બનાવ્યા વિના પ્રયોગો શરૂ કરી શકે છે, જોકે સાચી ખર્ચ-અસરકારકતા દરેક પ્લેટફોર્મના ભાવ નિર્ધારણ (pricing) પર આધાર રાખશે.

મુખ્ય વાત: Nemotron 3.5 Lightning સાબિત કરે છે કે એક મોડલ 120-બિલિયન-પેરામીટર સિસ્ટમ્સના રીઝનિંગ લેવલની બરાબરી કરી શકે છે અને સાથે જ અગ્રણી સ્પર્ધકો કરતા લગભગ બમણો ટોકન થ્રુપુટ આપી શકે છે, જે તેને લેટન્સી-સેન્સિટિવ AI એજન્ટ્સ માટે એક મજબૂત ઉમેદવાર બનાવે છે.