Nemotron 3 Nano 30B A3B, ਜੋ ਕਿ ਇਸਦਾ ਪੂਰਵਗਾਮੀ ਸੀ, ਪਹਿਲਾਂ ਹੀ ਵੱਡੇ ਫਾਊਂਡੇਸ਼ਨ ਮਾਡਲਾਂ ਦੇ ਇੱਕ ਸੰਖੇਪ ਵਿਕਲਪ ਵਜੋਂ ਸਥਾਪਿਤ ਸੀ। ਇੱਕ ਹਾਈਬ੍ਰਿਡ Mamba-Transformer ਆਰਕੀਟੈਕਚਰ ਵਿੱਚ ਬਦਲ ਕੇ ਅਤੇ ਕਿਸੇ ਵੀ ਸਮੇਂ ਸਿਰਫ਼ 3.6 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਸਰਗਰਮ ਕਰਕੇ, Lightning ਕੁਸ਼ਲਤਾ ਦੀ ਸੀਮਾ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ ਅਤੇ ਫਿਰ ਵੀ ਬਹੁਤ ਵੱਡੇ ਮਾਡਲਾਂ ਦੇ ਬਰਾਬਰ ਤਰਕ ਸ਼ਕਤੀ (reasoning power) ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
ਹੁਣ ਰਫ਼ਤਾਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
AI agents ਬੈਚ-ਸਟਾਈਲ ਇਨਫਰੈਂਸ (batch-style inference) ਤੋਂ ਲਗਾਤਾਰ ਇੰਟਰੈਕਸ਼ਨ ਵੱਲ ਵਧ ਰਹੇ ਹਨ। ਇੱਕ ਚੈਟਬੋਟ ਜੋ ਕਈ ਸਕਿੰਟਾਂ ਲਈ ਰੁਕ ਜਾਂਦਾ ਹੈ, ਉਹ ਸੁਸਤ ਮਹਿਸੂਸ ਹੁੰਦਾ ਹੈ; ਇੱਕ ਕੋਡ-ਕੰਪਲੀਸ਼ਨ ਟੂਲ ਜੋ ਡਿਵੈਲਪਰ ਦੀ ਟਾਈਪਿੰਗ ਤੋਂ ਪਿੱਛੇ ਰਹਿ ਜਾਂਦਾ ਹੈ, ਵਰਕਫਲੋ ਨੂੰ ਵਿਗਾੜ ਦਿੰਦਾ ਹੈ। ਅਜਿਹੇ ਮਾਹੌਲ ਵਿੱਚ, ਟੋਕਨ-ਪ੍ਰ-ਸਕਿੰਡ ਥਰੂਪੁੱਟ (token-per-second throughput) ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਪ੍ਰਤੀਕਿਰਿਆਸ਼ੀਲਤਾ (responsiveness) ਵਿੱਚ ਬਦਲ ਜਾਂਦਾ ਹੈ। 670-ਟੋਕਨ-ਪ੍ਰ-ਸਕਿੰਡ ਦਾ ਅੰਕੜਾ Google ਦੇ Gemini 3.5 Flash-Lite ਲਈ ਦੱਸੇ ਗਏ 386 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਡ ਤੋਂ ਲਗਭਗ ਦੁੱਗਣਾ ਹੈ, ਅਤੇ ਇਹ ਇੱਕ ਮਿਆਰੀ Intelligence Index ਕਾਰਜ ਨੂੰ ਖਤਮ ਕਰਨ ਦੇ ਸਮੇਂ ਨੂੰ ਲਗਭਗ ਅੱਧੇ ਮਿੰਟ ਤੱਕ ਘਟਾ ਦਿੰਦਾ ਹੈ। ਇਸ ਦੇ ਉਲਟ, Qwen 3.6 35B A3B ਨੂੰ ਉਸੇ ਕਾਰਜ ਲਈ 3.5 ਮਿੰਟਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਅਤੇ Gemma 4 31B ਨੂੰ 5.8 ਮਿੰਟਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਉਹ ਅੰਤਰ ਕਿਸੇ ਵੀ ਅਜਿਹੀ ਸੇਵਾ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜਿਸ ਨੂੰ ਬਹੁਤ ਸਾਰੀਆਂ ਸਮਾਨਾਂਤਰ ਬੇਨਤੀਆਂ (simultaneous requests) ਨੂੰ ਸੰਭਾਲਣਾ ਪੈਂਦਾ ਹੈ। ਇੱਕ ਸਰਵਰ ਜੋ ਉਸੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਦੁੱਗਣੇ ਟੋਕਨਾਂ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰ ਸਕਦਾ ਹੈ, ਉਹ ਜਾਂ ਤਾਂ ਲਾਗਤ ਘਟਾ ਸਕਦਾ ਹੈ ਜਾਂ ਸਮਰੱਥਾ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਸਕਦਾ ਹੈ, ਜੋ ਕਿ ਕਲਾਉਡ ਪ੍ਰੋਵਾਈਡਰਾਂ ਅਤੇ ਉਦਯੋਗਾਂ ਲਈ ਇੱਕ ਸਪੱਸ਼ਟ ਫਾਇਦਾ ਹੈ।
ਮਾਡਲ ਆਪਣੇ ਅੰਕੜੇ ਕਿਵੇਂ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ
Nemotron 3.5 Lightning ਦਾ ਹਾਈਬ੍ਰਿਡ ਆਰਕੀਟੈਕਚਰ Transformers ਦੀ ਲੰਬੇ-ਦੂਰੀ ਦੇ ਪੈਟਰਨ-ਪਛਾਣ ਦੀ ਸ਼ਕਤੀ ਨੂੰ Mamba ਬਲਾਕਾਂ ਦੀ ਸਟੇਟ-ਸਪੇਸ ਕੁਸ਼ਲਤਾ ਨਾਲ ਮਿਲਾਉਂਦਾ ਹੈ। ਇਹ ਡਿਜ਼ਾਈਨ ਮਾਡਲਿੰਗ ਸਮਰੱਥਾ ਨੂੰ ਬਣਾਈ ਰੱਖਣ ਲਈ ਕੁੱਲ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਿਣਤੀ ਨੂੰ ਉੱਚਾ—31.6 ਬਿਲੀਅਨ—ਰੱਖਦਾ ਹੈ, ਪਰ ਕਿਸੇ ਵੀ ਦਿੱਤੇ ਗਏ ਟੋਕਨ ਲਈ ਸਿਰਫ਼ 3.6 ਬਿਲੀਅਨ ਹੀ ਸਰਗਰਮ ਹੁੰਦੇ ਹਨ। Sparse activation ਪ੍ਰਤੀ ਟੋਕਨ ਕੰਪਿਊਟ (compute) ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਗੁਣਵੱਤਾ ਵਿੱਚ ਅਨੁਪਾਤਕ ਰੂਪ ਵਿੱਚ ਕਮੀ ਲਿਆਂਦੇ ਬਿਨਾਂ ਥਰੂਪੁੱਟ ਵਧਦਾ ਹੈ।
Artificial Analysis ਨੇ Lightning ਲਈ 24 ਦਾ Intelligence Index ਸਕੋਰ ਮਾਪਿਆ, ਜੋ ਕਿ ਪਿਛਲੇ Nano ਮਾਡਲ ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕੀਤੇ ਗਏ 15 ਦੇ ਮੁਕਾਬਲੇ ਨੌਂ ਅੰਕਾਂ ਦਾ ਉਛਾਲ ਹੈ। ਇਹ ਇਸਨੂੰ OpenAI ਦੇ gpt-oss-120b ਦੇ ਬਰਾਬਰ ਰੱਖਦਾ ਹੈ, ਭਾਵੇਂ ਕਿ Lightning ਲਗਭਗ ਇੱਕ ਚੌਥਾਈ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਇਹ ਅਜੇ ਵੀ ਚੋਟੀ ਦੇ ਮਾਡਲਾਂ—Meta ਦੇ Muse Glimmer (35) ਅਤੇ Qwen 3.6 35B A3B (32)— ਤੋਂ ਪਿੱਛੇ ਹੈ—ਪਰ ਇਸਦਾ intelligence-to-parameter ਅਨੁਪਾਤ ਸਭ ਤੋਂ ਵਧੀਆ ਰੈਂਕਾਂ ਵਿੱਚ ਆਉਂਦਾ ਹੈ।
Agentic ਬੈਂਚਮਾਰਕ ਵੀ ਇਹੀ ਕਹਾਣੀ ਦੱਸਦੇ ਹਨ
Agentic ਵਰਕਲੋਡ—ਯੋਜਨਾਬੰਦੀ, ਟੂਲ ਦੀ ਵਰਤੋਂ, ਮਲਟੀ-ਸਟੈਪ ਤਰਕ—ਉਹ ਖੇਤਰ ਹਨ ਜਿੱਥੇ Lightning ਚਮਕਦਾ ਹੈ। GDPval-AA v2 ਬੈਂਚਮਾਰਕ 'ਤੇ, ਮਾਡਲ ਨੇ 824 ਦੀ Elo ਰੇਟਿੰਗ ਪ੍ਰਾਪਤ ਕੀਤੀ, ਜੋ ਕਿ 120-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ gpt-oss-120b (800) ਅਤੇ Nvidia ਦੇ ਆਪਣੇ ਵੱਡੇ Nemotron 3 Super (698) ਤੋਂ ਅੱਗੇ ਹੈ। Terminal-Bench v2.1 ਟੈਸਟ ਵਿੱਚ, Lightning ਦੀ ਸਫਲਤਾ ਦਰ 7 % ਤੋਂ ਵਧ ਕੇ 24.3 % ਹੋ ਗਈ, ਜੋ ਕਿ gpt-oss-120b ਦੁਆਰਾ ਰਿਕਾਰਡ ਕੀਤੇ ਗਏ 26.2 % ਦੇ ਨੇੜੇ ਪਹੁੰਚ ਗਈ ਹੈ।
Nvidia ਨੇ ਡੋਮੇਨ-ਵਿਸ਼ੇਸ਼ ਕਾਰਜਾਂ 'ਤੇ ਮਾਡਲ ਨੂੰ ਟਿਊਨ ਕਰਨ ਲਈ CodeRabbit ਅਤੇ Harvey ਵਰਗੇ ਭਾਈਵਾਲਾਂ ਨਾਲ ਪੋਸਟ-ਟ੍ਰੇਨਿੰਗ ਸਹਿਯੋਗ ਦਾ ਸਿਹਰਾ ਦਿੱਤਾ ਹੈ। ਉਹ ਸੁਧਾਰ ਮਾਡਲ ਨੂੰ ਤੇਜ਼ ਰੱਖਦੇ ਹਨ ਅਤੇ ਵਿਸ਼ੇਸ਼ ਵਰਕਲੋਡਾਂ 'ਤੇ ਮੁਕਾਬਲੇਬਾਜ਼ ਬਣੇ ਰਹਿਣ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ।
ਉਪਲਬਧਤਾ ਅਤੇ ਵਿਹਾਰਕ ਵਿਚਾਰ
ਮਾਡਲ permissive OpenMDW-1.1 ਲਾਇਸੈਂਸ ਦੇ ਅਧੀਨ ਆਉਂਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ BF16 ਅਤੇ NVFP4 ਫਾਰਮੈਟਾਂ ਵਿੱਚ ਵੇਟਸ (weights) ਹਨ। NVFP4 ਵੇਰੀਐਂਟ ਘੱਟ ਤੋਂ ਘੱਟ ਗੁਣਵੱਤਾ ਦੇ ਨੁਕਸਾਨ ਦੇ ਨਾਲ ਮਾਡਲ ਨੂੰ ਵਧੇਰੇ ਸੰਘਣੀ ਤਰ੍ਹਾਂ ਪੈਕ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ edge deployments ਜਾਂ ਲਾਗਤ-ਸਚੇਤ ਕਲਾਉਡ ਇੰਸਟੈਂਸਾਂ ਲਈ ਇੱਕ ਲਾਭਦਾਇਕ ਵਿਕਲਪ ਹੈ। ਇੱਕ ਮਿਲੀਅਨ-ਟੋਕਨ ਕੰਟੈਕਸ ਵਿੰਡੋ ਮਾਡਲ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਕਟੌਤੀ ਦੇ ਬਹੁਤ ਲੰਬੇ ਪ੍ਰੋਂਪਟਾਂ ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ, ਜੋ ਕਿ ਦਸ
