Nvidia ਨੇ 11 ਅਗਸਤ ਨੂੰ Nemotron 3.5 Lightning ਲਾਂਚ ਕੀਤਾ। ਇਹ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ mixture-of-experts ਮਾਡਲ ਸਿਰਫ਼ 3 ਬਿਲੀਅਨ ਸਰਗਰਮ (active) ਪੈਰਾਮੀਟਰਾਂ ਨਾਲ ਚੱਲਦਾ ਹੈ, ਅਤੇ ਇਸਦੀ ਸਾਥੀ NeMo Switchyard routing library ਨੇ ਇਨਫਰੈਂਸ (inference) ਲਾਗਤਾਂ ਅਤੇ ਕੈਸ਼ ਕੁਸ਼ਲਤਾ (cache efficiency) ਬਾਰੇ ਪਹਿਲਾਂ ਹੀ ਇੱਕ ਬਹਿਸ ਛੇੜ ਦਿੱਤੀ ਹੈ। Switchyard ਜਿਸ ਤਰੀਕੇ ਨਾਲ ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਰਿਕੁਐਸਟਾਂ ਨੂੰ ਭੇਜਦਾ ਹੈ, ਉਹ ਪ੍ਰੋਂਪਟ ਕੈਸ਼ (prompt caches) ਨੂੰ ਖਰਾਬ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਇੱਕ ਸਿੰਗਲ ਇਨਫਰੈਂਸ ਸੈਸ਼ਨ ਲਈ ਬਿੱਲ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਸਕਦਾ ਹੈ।
ਓਪਨ-ਵੇਟ (open-weight) ਏਜੰਟਾਂ ਲਈ ਬਣਾਇਆ ਗਿਆ ਇੱਕ ਮਾਡਲ
Nemotron 3.5 Lightning ਉਨ੍ਹਾਂ AI ਏਜੰਟਾਂ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਟੂਲਸ (tools) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਨਤੀਜਿਆਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਦੇ ਹਨ, ਅਤੇ ਤਰਕ ਦਾ ਪਤਾ (reasoning trace) ਰੱਖਦੇ ਹਨ। ਤਿੰਨ ਤਕਨੀਕੀ ਚੋਣਾਂ ਇਸਨੂੰ ਵੱਖਰਾ ਬਣਾਉਂਦੀਆਂ ਹਨ:
- ਹਾਈਬ੍ਰਿਡ ਆਰਕੀਟੈਕਚਰ (Hybrid architecture) – ਇਹ ਇੱਕ Mamba-2 state-space ਕੋਰ ਨੂੰ ਰਵਾਇਤੀ Transformer ਨਾਲ ਜੋੜਦਾ ਹੈ, ਜੋ ਇਹ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ non-Transformer ਡਿਜ਼ਾਈਨ ਵੀ ਇਸ ਪੱਧਰ 'ਤੇ ਮੁਕਾਬਲਾ ਕਰ ਸਕਦੇ ਹਨ।
- 4-bit floating-point quantization – ਲੋਅ-ਪ੍ਰੀਸੀਜ਼ਨ (low-precision) ਵਿੱਚ ਹੋਣ ਕਾਰਨ, 30 B ਮਾਡਲ ਇੱਕ M5 Max MacBook Pro 'ਤੇ ਲਗਭਗ 100 ਟੋਕਨ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ, ਇੱਕ ਅਜਿਹੀ ਰਫ਼ਤਾਰ ਜਿਸ ਨਾਲ ਇੱਕ ਫੁੱਲ-ਪ੍ਰੀਸੀਜ਼ਨ ਮਾਡਲ ਨੂੰ ਮਿਲਾਨ ਕਰਨ ਵਿੱਚ ਮੁਸ਼ਕਲ ਆਵੇਗੀ।
- ਪੂਰੀ ਖੁੱਲ੍ਹ (Full openness) – Nvidia ਨੇ ਵੇਟ ਫਾਈਲਾਂ (weight files) ਅਤੇ ਪੂਰੀ ਟ੍ਰੇਨਿੰਗ ਰੈਸਿਪੀ (training recipe) ਜਾਰੀ ਕੀਤੀ ਹੈ, ਜੋ ਕਿ ਉੱਚ-ਪ੍ਰਦਰਸ਼ਨ ਵਾਲੇ ਇਨਫਰੈਂਸ ਲਈ ਬਣਾਏ ਗਏ ਮਾਡਲ ਲਈ ਇੱਕ ਦੁਰਲੱਭ ਗੱਲ ਹੈ।
ਸ਼ੁਰੂਆਤੀ ਉਪਭੋਗਤਾਵਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਮਾਡਲ "ਓਵਰ-ਥਿੰਕ" (over-think) ਕਰ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਲੰਬੀਆਂ ਤਰਕ ਲੜੀਆਂ (reasoning chains) ਨਿਕਲਦੀਆਂ ਹਨ ਜੋ ਕਦੇ-ਕਦੇ ਗਲਤ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ, ਖੁੱਲ੍ਹੇ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਏਜੰਟ ਐਗਜ਼ੀਕਿਊਟਰ (agent executor) ਮਿਲਦਾ ਹੈ ਪਰ ਬੇਲੋੜੀ ਵਾਧੂ ਜਾਣਕਾਰੀ ਤੋਂ ਬਚਣ ਲਈ ਉਨ੍ਹਾਂ ਨੂੰ ਸਾਵਧਾਨੀ ਨਾਲ ਪ੍ਰੋਂਪਟ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ।
ਰੂਟਿੰਗ ਲੇਅਰ (routing layer) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
NeMo Switchyard ਉਪਲਬਧ ਮਾਡਲਾਂ ਦੇ ਸਮੂਹ ਵਿੱਚੋਂ ਕਿਸੇ ਰਿਕੁਐਸਟ ਨੂੰ "ਸਭ ਤੋਂ ਵਧੀਆ" ਮਾਡਲ ਤੱਕ ਡਾਇਨਾਮਿਕ ਤੌਰ 'ਤੇ ਪਹੁੰਚਾਉਣ ਲਈ Nvidia ਦੀ ਲਾਇਬ੍ਰੇਰੀ ਹੈ। ਸਿਧਾਂਤਕ ਤੌਰ 'ਤੇ, ਇੱਕ ਰੂਟਰ ਹਰੇਕ ਕੁਐਰੀ (query) ਲਈ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਮਾਡਲ ਚੁਣ ਕੇ ਜਵਾਬ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਵਧਾ ਸਕਦਾ ਹੈ। ਅਸਲ ਵਿੱਚ, ਰੂਟਿੰਗ ਦਾ ਫੈਸਲਾ ਪ੍ਰੋਂਪਟ-ਕੈਸ਼ਿੰਗ (prompt-caching) ਵਿਧੀਆਂ ਨਾਲ ਟਕਰਾਉਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ 'ਤੇ ਬਹੁਤ ਸਾਰੇ ਇਨਫਰੈਂਸ ਪਾਈਪਲਾਈਨ ਨਿਰਭਰ ਕਰਦੇ ਹਨ।
- ਪ੍ਰੋਂਪਟ ਕੈਸ਼ (Prompt caches) ਸ਼ੁਰੂਆਤੀ ਪ੍ਰੋਂਪਟ ਦੇ ਟੋਕਨ ਐਮਬੈਡਿੰਗਸ (token embeddings) ਨੂੰ ਸਟੋਰ ਕਰਦੇ ਹਨ ਤਾਂ ਜੋ ਬਾਅਦ ਵਿੱਚ ਜਨਰੇਸ਼ਨਾਂ "prefill" ਸਟੈਪ ਨੂੰ ਦੁਬਾਰਾ ਕੰਪਿਊਟ ਕੀਤੇ ਬਿਨਾਂ ਉਹਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਣ।
- ਰੂਟਿੰਗ ਸਵੈਪਸ (Routing swaps) ਪਹਿਲੇ ਕੁਝ ਟੋਕਨਾਂ ਤੋਂ ਬਾਅਦ ਰਿਕੁਐਸਟ ਨੂੰ ਮਾਡਲ A ਤੋਂ ਮਾਡਲ B ਵਿੱਚ ਲੈ ਜਾਂਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਸਿਸਟਮ ਨੂੰ ਕੈਸ਼ ਕੀਤੇ ਪ੍ਰੋਂਪਟ ਨੂੰ ਰੱਦ ਕਰਨ ਅਤੇ ਨਵੇਂ ਮਾਡਲ ਲਈ ਇਸਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਦੁਬਾਰਾ ਕੰਪਿਊਟ ਕਰਨ ਲਈ ਮਜਬੂਰ ਹੋਣਾ ਪੈਂਦਾ ਹੈ।
ਕਿਉਂਕਿ ਜ਼ਿਆਦਾਤਰ AI ਖਰਚਾ ਨਵੇਂ ਟੋਕਨ ਬਣਾਉਣ ਦੀ ਬਜਾਏ ਕੈਸ਼ ਕੀਤੇ ਪ੍ਰੋਂਪਟ ਨੂੰ ਪੜ੍ਹਨ 'ਤੇ ਹੁੰਦਾ ਹੈ, ਇੱਕ ਸਿੰਗਲ ਰੂਟਿੰਗ ਹੌਪ (routing hop) ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤੌਰ 'ਤੇ ਇੱਕ ਰਿਕੁਐਸ ਦੀ ਲਾਗਤ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਸਕਦਾ ਹੈ।
ਲਾਗਤ ਦੀ ਖਿੱਚੋਤਾਣੀ
ਭਵਿੱਖ ਵਿੱਚ ਕੀ ਹੈ
ਇਹ ਬਹਿਸ ਉਦੋਂ ਆਈ ਹੈ ਜਦੋਂ Nvidia ਦੀ ਓਪਨ-ਵੇਟ ਰਣਨੀਤੀ ਦਾ ਸਿੱਧਾ ਮੁਕਾਬਲਾ ਹੋ ਰਿਹਾ ਹੈ। 15 ਅਗਸਤ ਨੂੰ Qwen 3.8-27B ਲਾਂਚ ਹੋਵੇਗਾ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਬੈਂਚਮਾਰਕਸ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ ਇਹ ਲੋਕਲ ਡਿਵੈਲਪਮੈਂਟ ਸਥਿਤੀਆਂ ਵਿੱਚ Nemotron 3.5 Lightning ਦਾ ਮੁਕਾਬਲਾ ਕਰ ਸਕਦਾ ਹੈ।
Nvidia ਦਾ ਪੈਟਰਨ—ਓਪਨ ਵੇਟਸ, ਓਪਨ ਟ੍ਰੇਨਿੰਗ ਰੈਸਿਪੀਜ਼, ਅਤੇ ਇੱਕ ਓਪਨ ਰੂਟਿੰਗ ਲੇਅਰ—ਇਸ ਤਰ੍ਹਾਂ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਜਾਪਦਾ ਹੈ ਕਿ ਉਸਦੇ GPUs ਉਹਨਾਂ ਸਾਰਿਆਂ ਲਈ ਡਿਫੌਲਟ ਹਾਰਡਵੇਅਰ ਬਣ ਜਾਣ ਜੋ ਇਹਨਾਂ ਮਾਡਲਾਂ ਨੂੰ ਲੋਕਲ ਤੌਰ 'ਤੇ ਚਲਾ ਰਹੇ ਹਨ। ਸਾਫਟਵੇਅਰ ਸਟੈਕ ਨੂੰ ਉਜਾਗਰ ਕਰਕੇ, Nvidia ਉਮੀਦ ਕਰਦਾ ਹੈ ਕਿ ਉਹ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਆਪਣੇ ਈਕੋਸਿਸਟਮ ਵਿੱਚ ਬੰਨ੍ਹ ਸਕੇ, ਭਾਵੇਂ ਰੂਟਿੰਗ ਲੌਜਿਕ ਲੁਕਵੀਂ ਲਾਗਤ ਵਧਾ ਦੇਵੇ।
ਸਿੱਖਿਆ (Takeaway)
ਜੇਕਰ ਤੁਸੀਂ ਆਪਣੇ ਮਸ਼ੀਨ 'ਤੇ Nemotron 3.5 Lightning ਚਲਾਉਣ ਦੀ ਯੋਜਨਾ ਬਣਾਉਂਦੇ ਹੋ, ਤਾਂ ਸਿਰਫ਼ ਇਹ ਨਾ ਪੁੱਛੋ ਕਿ "ਇਹ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਜਨਰੇਟ ਕਰ ਸਕਦਾ ਹੈ?" ਬਲਕਿ ਇਹ ਵੀ ਪੁੱਛੋ ਕਿ "Switchyard ਮੈਨੂੰ ਕਿੰਨੀ ਵਾਰ ਮੇਰਾ ਪ੍ਰੋਂਪਟ ਕੈਸ਼ ਰੱਦ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰੇਗਾ?" ਉਹ ਜਵਾਬ ਇਹ ਨਿਰਧਾਰਤ ਕਰੇਗਾ ਕਿ ਮਾਡਲ ਦਾ ਓਪਨ-ਵੇਟ ਵਾਅਦਾ ਅਸਲ ਦੁਨੀਆ ਵਿੱਚ ਬਚਤ ਬਣੇਗਾ ਜਾਂ ਇੱਕ ਮਹਿੰਗਾ ਪ੍ਰਯੋਗ। ਜਿਵੇਂ ਕਿ Qwen ਵਰਗੇ ਵਿਕਲਪ ਆ ਰਹੇ ਹਨ, ਰੂਟਿੰਗ ਲਚਕਤਾ ਅਤੇ ਕੈਸ਼-ਡ੍ਰਿਵਨ ਲਾਗਤ ਕੁਸ਼ਲਤਾ ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਇਹ ਫੈਸਲਾ ਕਰੇਗਾ ਕਿ ਕਿਹੜਾ ਟੂਲਕਿੱਟ—ਅਤੇ ਅੰਤ ਵਿੱਚ ਕਿਹੜਾ ਹਾਰਡਵੇਅਰ ਪਲੇਟਫਾਰਮ—ਜਿੱਤੇਗਾ।
