മുൻഗാമിയായ Nemotron 3 Nano 30B A3B, വലിയ ഫൗണ്ടേഷൻ മോഡലുകൾക്ക് പകരമായി ഒരു കോംപാക്ട് ഓപ്ഷനായി ഇതിനകം തന്നെ നിലയുറപ്പിച്ചിരുന്നു. ഒരു ഹൈബ്രിഡ് Mamba-Transformer ആർക്കിടെക്ചറിലേക്ക് മാറുന്നതിലൂടെയും ഏത് നിമിഷവും 3.6 ബില്യൺ പാരാമീറ്ററുകൾ മാത്രം സജീവമാക്കുന്നതിലൂടെയും, വലിയ മോഡലുകൾക്ക് തുല്യമായ റീസണിംഗ് പവർ (reasoning power) നിലനിർത്തിക്കൊണ്ടുതന്നെ Lightning കാര്യക്ഷമതയുടെ പുതിയ അതിരുകൾ കീഴടക്കുന്നു.

എന്തുകൊണ്ടാണ് ഇപ്പോൾ വേഗത പ്രധാനമാകുന്നത്

AI ഏജന്റുകൾ ബാച്ച്-സ്റ്റൈൽ ഇൻഫറൻസിൽ (batch-style inference) നിന്ന് തുടർച്ചയായ സംവേദനത്തിലേക്കാണ് (continuous interaction) മാറിക്കൊണ്ടിരിക്കുന്നത്. ഏതാനും സെക്കൻഡുകൾ നിർത്തിനിൽക്കുന്ന ഒരു ചാറ്റ്ബോട്ട് മന്ദഗതിയിലുള്ളതായി തോന്നും; ഒരു ഡെവലപ്പർ ടൈപ്പ് ചെയ്യുന്നതിനൊപ്പം എത്താൻ കഴിയാത്ത കോഡ്-കംപ്ലീഷൻ ടൂൾ വർക്ക്ഫ്ലോയെ തടസ്സപ്പെടുത്തും. ഇത്തരം സാഹചര്യങ്ങളിൽ, സെക്കൻഡിൽ എത്ര ടോക്കണുകൾ കൈകാര്യം ചെയ്യുന്നു (token-per-second throughput) എന്നത് അതിന്റെ പ്രതികരണശേഷിയെ (responsiveness) നേരിട്ട് ബാധിക്കുന്നു. സെക്കൻഡിൽ 670 ടോക്കണുകൾ എന്ന നിരക്ക് Google-ന്റെ Gemini 3.5 Flash-Lite-ന് റിപ്പോർട്ട് ചെയ്ത 386 ടോക്കണുകളുടെ ഏകദേശം ഇരട്ടിയാണ്. ഇത് ഒരു സ്റ്റാൻഡേർഡ് Intelligence Index ടാസ്ക് പൂർത്തിയാക്കാനുള്ള സമയം ഏകദേശം അര മിനിറ്റായി കുറയ്ക്കുന്നു. ഇതിനു വിപരീതമായി, ഇതേ ടാസ്കിനായി Qwen 3.6 35B A3B-ന് 3.5 മിനിറ്റും Gemma 4 31B-ന് 5.8 മിനിറ്റും ആവശ്യമാണ്.

ഒരേസമയം നിരവധി റിക്വസ്റ്റുകൾ കൈകാര്യം ചെയ്യേണ്ടി വരുന്ന ഏതൊരു സേവനത്തിനും ഈ വ്യത്യാസം വളരെ പ്രധാനമാണ്. ഒരേ ഹാർഡ്‌വെയറിൽ തന്നെ ഇരട്ടി ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യാൻ കഴിയുന്ന ഒരു സെർവറിന് ചെലവ് കുറയ്ക്കാനോ അല്ലെങ്കിൽ ശേഷി (capacity) ഇരട്ടിയാക്കാനോ കഴിയും; ഇത് ക്ലൗഡ് പ്രൊവൈഡർമാർക്കും സംരംഭങ്ങൾക്കും വലിയൊരു നേട്ടമാണ്.

ഈ മോഡൽ എങ്ങനെയാണ് ഇത്രയും മികച്ച ഫലങ്ങൾ കൈവരിക്കുന്നത്

Nemotron 3.5 Lightning-ന്റെ ഹൈബ്രിഡ് ആർക്കിടെക്ചർ, Transformers-ന്റെ ദീർഘദൂര പാറ്റേൺ തിരിച്ചറിയാനുള്ള (long-range pattern-recognition) കഴിവും Mamba ബ്ലോക്കുകളുടെ സ്റ്റേറ്റ്-സ്പേസ് കാര്യക്ഷമതയും (state-space efficiency) സമന്വയിപ്പിക്കുന്നു. മോഡലിംഗ് ശേഷി നിലനിർത്തുന്നതിനായി ആകെ പാരാമീറ്റർ എണ്ണം 31.6 ബില്യൺ എന്ന ഉയർന്ന നിലയിൽ തന്നെ ഈ ഡിസൈൻ സൂക്ഷിക്കുന്നുണ്ടെങ്കിലും, ഓരോ ടോക്കണിനും 3.6 ബില്യൺ പാരാമീറ്ററുകൾ മാത്രമേ സജീവമാകൂ. സ്പാർസ് ആക്റ്റിവേഷൻ (Sparse activation) ഓരോ ടോക്കണിനും വേണ്ട കമ്പ്യൂട്ട് കുറയ്ക്കുന്നു, ഇത് ഗുണനിലവാരത്തിൽ വലിയ കുറവില്ലാതെ തന്നെ പ്രോസസ്സിംഗ് വേഗത (throughput) വർദ്ധിപ്പിക്കുന്നു.

Artificial Analysis നടത്തിയ പരിശോധനയിൽ Lightning-ന് 24 ആണ് Intelligence Index സ്കോർ ലഭിച്ചത്, ഇത് മുൻപത്തെ Nano മോഡലിന്റെ 15 എന്ന സ്കോറിൽ നിന്നുള്ള ഒൻപത് പോയിന്റുകളുടെ വർദ്ധനവാണ്. Lightning ഏകദേശം നാലിലൊന്ന് പാരാമീറ്ററുകൾ മാത്രമേ ഉപയോഗിക്കുന്നുള്ളൂ എങ്കിലും, ഇത് OpenAI-യുടെ gpt-oss-120b-ന് തുല്യമാണ്. Meta-യുടെ Muse Glimmer (35), Qwen 3.6 35B A3B (32) എന്നീ മികച്ച മോഡലുകൾക്ക് പിന്നിലാണെങ്കിലും, ഇതിന്റെ ഇന്റലിജൻസ്-ടു-പാരാമീറ്റർ അനുപാതം (intelligence-to-parameter ratio) ഏറ്റവും മികച്ചവയിൽ ഒന്നാണ്.

ഏജന്റിക് ബെഞ്ച്മാർക്കുകളും സമാനമായ കഥയാണ് പറയുന്നത്

പ്ലാനിംഗ്, ടൂൾ ഉപയോഗം, മൾട്ടി-സ്റ്റെപ്പ് റീസണിംഗ് തുടങ്ങിയ ഏജന്റിക് വർക്ക്ലോഡുകളിൽ (Agentic workloads) Lightning മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു. GDPval-AA v2 ബെഞ്ച്മാർക്കിൽ, ഈ മോഡൽ 824 Elo റേറ്റിംഗ് നേടി, 120 ബില്യൺ പാരാമീറ്ററുകളുള്ള gpt-oss-120b (800), Nvidia-യുടെ തന്നെ വലിയ മോഡലായ Nemotron 3 Super (698) എന്നിവയെ മറികടന്നു. Terminal-Bench v2.1 ടെസ്റ്റിൽ, Lightning-ന്റെ വിജയശതമാനം 7 ശതമാനത്തിൽ നിന്ന് 24.3 ശതമാനമായി ഉയർന്നു, ഇത് gpt-oss-120b രേഖപ്പെടുത്തിയ 26.2 ശതമാനത്തോട് അടുക്കുന്നു.

ഡൊമെയ്ൻ-സ്പെസിഫിക് ടാസ്ക്കുകൾക്കായി (domain-specific tasks) മോഡലിനെ ട്യൂൺ ചെയ്യുന്നതിൽ CodeRabbit, Harvey തുടങ്ങിയ പങ്കാളികളുമായുള്ള പോസ്റ്റ്-ട്രെയിനിംഗ് സഹകരണങ്ങളെ Nvidia ഇതിന് കാരണമായി ചൂണ്ടിക്കാട്ടുന്നു. ഈ പരിഷ്കാരങ്ങൾ മോഡലിനെ വേഗതയുള്ളതാക്കി നിലനിർത്തുന്നതോടൊപ്പം സവിശേഷമായ വർക്ക്ലോഡുകളിൽ മത്സരക്ഷമതയും ഉറപ്പാക്കുന്നു.

ലഭ്യതയും പ്രായോഗികമായ കാര്യങ്ങളും

ഈ മോഡൽ അനുമതി നൽകുന്ന OpenMDW-1.1 ലൈസൻസിന് കീഴിലാണ് ലഭ്യമാകുന്നത്, കൂടാതെ BF16, NVFP4 ഫോർമാറ്റുകളിലുള്ള വെയ്റ്റുകളും (weights) ലഭ്യമാണ്. NVFP4 വേരിയന്റ് ഗുണനിലവാരത്തിൽ കുറവില്ലാതെ തന്നെ മോഡലിനെ കൂടുതൽ കംപാക്ട് ആയി പാക്ക് ചെയ്യുന്നു, ഇത് എഡ്ജ് ഡിപ്ലോയ്‌മെന്റുകൾക്കോ (edge deployments) ചെലവ് കുറഞ്ഞ ക്ലൗഡ് ഇൻസ്റ്റൻസുകൾക്കോ അനുയോജ്യമായ ഒരു ഓപ്ഷനാണ്. ഒരു മില്യൺ ടോക്കണുകൾ ഉൾക്കൊള്ളാൻ കഴിയുന്ന കോൺടെക്സ്റ്റ് വിൻഡോ (context window) ഉള്ളതിനാൽ, ഡോക്യുമെന്റ് തലത്തിലുള്ള വിശകലനത്തിനോ വിപുലമായ കോഡ്ബേസുകൾക്കോ ആവശ്യമായ വലിയ പ്രോംപ്റ്റുകൾ മുറിച്ചുമാറ്റാതെ തന്നെ കൈകാര്യം ചെയ്യാൻ മോഡലിന് സാധിക്കും.

DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius, Crusoe തുടങ്ങിയ പ്രൊവൈഡർമാർ വഴി സെർവ്ലെസ് ഇൻഫറൻസ് (Serverless inference) ഇപ്പോൾ ലഭ്യമാണ്. സ്വന്തമായി ഇൻഫ്രാസ്ട്രക്ചർ നിർമ്മിക്കാതെ തന്നെ ഡെവലപ്പർമാർക്ക് പരീക്ഷണങ്ങൾ തുടങ്ങാം, എങ്കിലും യഥാർത്ഥ ചെലവ് ലാഭക്ഷമത ഓരോ പ്ലാറ്റ്‌ഫോമിന്റെയും വിലനിർണ്ണയത്തെ ആശ്രയിച്ചിരിക്കും.

ചുരുക്കത്തിൽ: 120 ബില്യൺ പാരാമീറ്റർ സിസ്റ്റങ്ങളുടെ റീസണിംഗ് നിലവാരത്തിന് തുല്യമാകാൻ കഴിയുമെന്നും, മുൻനിര എതിരാളികളേക്കാൾ ഇരട്ടിയിലധികം ടോക്കൺ പ്രോസസ്സിംഗ് വേഗത നൽകാൻ കഴിയുമെന്നും Nemotron 3.5 Lightning തെളിയിക്കുന്നു. ഇത് ലേറ്റൻസി-സെൻസിറ്റീവ് (latency-sensitive) ആയ AI ഏജന്റുകൾക്ക് മികച്ചൊരു ഓപ്ഷനാക്കുന്നു.