DeepMind ਨੇ ਇਸ ਹਫ਼ਤੇ DiffusionGemma ਨੂੰ ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ open-weight ਭਾਸ਼ਾ ਮਾਡਲ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ H100 GPU 'ਤੇ ਲਗਭਗ 1,500 ਟੋਕਨ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਤੱਕ ਜਨਰੇਟ ਕਰ ਸਕਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਸਟੈਂਡਰਡ Gemma 4 ਮਾਡਲ 303 ਟੋਕਨ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਦੇ ਨੇੜੇ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ। ਇਹ ਰਫ਼ਤਾਰ ਦਾ ਵਾਧਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਉਸ ਲੇਟੈਂਸੀ (latency) ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ ਜੋ ਰੀਅਲ-ਟਾਈਮ ਐਪਲੀਕੇਸ਼ਨਾਂ ਵਿੱਚ AI-ਡਰਾਈਵਨ ਏਜੰਟਾਂ ਨੂੰ ਹੌਲੀ ਕਰ ਦਿੰਦੀ ਹੈ।
DiffusionGemma ਟੋਕਨ-ਦਰ-ਟੋਕਨ ਦੀ ਆਦਤ ਨੂੰ ਕਿਵੇਂ ਤੋੜਦਾ ਹੈ
ਜ਼ਿਆਦਾਤਰ ਆਧੁਨਿਕ ਭਾਸ਼ਾ ਮਾਡਲ ਟੈਕਸਟ ਨੂੰ autoregressively ਜਨਰੇਟ ਕਰਦੇ ਹਨ: ਉਹ ਇੱਕ ਟੋਕਨ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦੇ ਹਨ, ਉਸਨੂੰ ਮਾਡਲ ਵਿੱਚ ਵਾਪਸ ਭੇਜਦੇ ਹਨ, ਅਤੇ ਫਿਰ ਅਗਲੇ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦੇ ਹਨ। ਇਹ "ਖੱਬੇ- ਤੋਂ-ਸੱਜੇ" (left-to-right) ਲੂਪ ਕੰਪਿਊਟ ਅਤੇ ਮੈਮੋਰੀ ਵਿਚਕਾਰ ਇੱਕ ਗੂੜ੍ਹਾ ਸਬੰਧ ਬਣਾਉਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਹਰ ਇੱਕ ਟੋਕਨ ਲਈ ਮਾਡਲ ਦੇ ਵੇਟਸ (weights) ਤੱਕ ਪਹੁੰਚਣਾ ਜ਼ਰੂਰੀ ਹੁੰਦਾ ਹੈ। DiffusionGemma ਇਸ ਲੂਪ ਨੂੰ ਇੱਕ discrete diffusion ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਬਦਲ ਦਿੰਦਾ ਹੈ ਜੋ 256-ਟੋਕਨ ਦੇ ਚੰਕ (chunk) ਨੂੰ ਨੋਇਜ਼ੀ ਡੇਟਾ ਦੇ ਇੱਕ ਸਿੰਗਲ ਬਲਾਕ ਵਜੋਂ ਮੰਨਦਾ ਹੈ। ਫਿਰ ਮਾਡਲ ਪੂਰੇ ਬਲਾਕ ਨੂੰ ਸਹਿਦਰ (parallel) ਤਰੀਕੇ ਨਾਲ ਡਿਨੋਇਜ਼ (denoise) ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਕੰਮ ਦਾ ਬੋਝ ਵਾਰ-ਵਾਰ ਵੇਟਸ ਲੁੱਕਅੱਪ ਕਰਨ ਦੀ ਬਜਾਏ ਹਰ ਸਟੈਪ 'ਤੇ ਵਧੇਰੇ ਕੰਪਿਊਟਿੰਗ ਵੱਲ ਤਬਦੀਲ ਹੋ ਜਾਂਦਾ ਹੈ। Nvidia ਦੇ H100 ਵਰਗੇ ਹਾਰਡਵੇਅਰ 'ਤੇ, ਜੋ ਪੈਰਲਲ ਮੈਥ (parallel math) ਵਿੱਚ ਮਾਹਰ ਹਨ, ਇਹ ਤਬਦੀਲੀ ਫਾਇਦੇਮੰਦ ਸਾਬਤ ਹੁੰਦੀ ਹੈ।
AI ਏਜੰਟਾਂ ਲਈ ਰਫ਼ਤਾਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਆਟੋਨੋਮਸ ਏਜੰਟ ਆਮ ਤੌਰ 'ਤੇ ਸਰਚਿੰਗ, ਸਮਰਾਈਜ਼ਿੰਗ ਅਤੇ ਟੈਸਟਿੰਗ ਦਾ ਇੱਕ ਚੱਕਰ ਚਲਾਉਂਦੇ ਹਨ। ਹਰੇਕ ਕਦਮ ਵਿੱਚ ਕਈ ਮਾਡਲ ਕਾਲ ਸ਼ਾਮਲ ਹੋ ਸਕਦੇ ਹਨ, ਇਸ ਲਈ ਪ੍ਰਤੀ-ਟੋਕਨ ਲੇਟੈਂਸੀ ਤੇਜ਼ੀ ਨਾਲ ਵਧਦੀ ਜਾਂਦੀ ਹੈ। ਜਦੋਂ ਕੋਈ ਮਾਡਲ ਰੁਕ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਪੂਰੀ ਏਜੰਟ ਪਾਈਪਲਾਈਨ ਲੰਬੀ ਹੋ ਜਾਂਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਲਾਗਤ ਵਧਦੀ ਹੈ ਅਤੇ ਯੂਜ਼ਰ ਅਨੁਭਵ ਖਰਾਬ ਹੁੰਦਾ ਹੈ।
ਪਰਫਾਰਮੈਂਸ ਦਾ ਤਬਾਦਲਾ (performance trade-off)
DiffusionGemma ਦੀ ਰਫ਼ਤਾਰ ਕਾਬਲੀਅਤ ਵਿੱਚ ਇੱਕ ਮਾਪਣਯੋਗ ਕਮੀ ਦੇ ਨਾਲ ਆਉਂਦੀ ਹੈ। AIME ਬੈਂਚਮਾਰਕ ਵਿੱਚ—ਜੋ ਤਰਕ (reasoning), ਤੱਥਾਂ ਦੀ ਸੱਚਾਈ (factuality) ਅਤੇ ਭਾਸ਼ਾ ਦੀ ਸਮਝ ਨੂੰ ਮਾਪਦਾ ਹੈ—DiffusionGemma 69.1 ਸਕੋਰ ਕਰਦਾ ਹੈ, ਜਦੋਂ ਕਿ Gemma 4 88.3 ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ। ਡਿਫਿਊਜ਼ਨ ਪਹੁੰਚ ਬਹੁਤ ਛੋਟੇ ਆਉਟਪੁੱਟ ਦੇ ਨਾਲ ਕਮਜ਼ੋਰੀਆਂ ਵੀ ਦਿਖਾਉਂਦੀ ਹੈ ਅਤੇ ਕਦੇ-ਕਦੇ ਟੋਕਨ "ਸਟੱਟਰਿੰਗ" (stuttering) ਹੁੰਦੀ ਹੈ, ਜਿੱਥੇ ਜਨਰੇਟ ਕੀਤਾ ਟੈਕਸਟ ਦੁਹਰਾਇਆ ਜਾਂਦਾ ਹੈ ਜਾਂ ਰੁਕਦਾ ਹੈ। ਜਦੋਂ ਇੱਕੋ ਸਮੇਂ ਲਗਭਗ 32 ਤੋਂ ਵੱਧ ਯੂਜ਼ਰ ਮਾਡਲ ਨੂੰ ਕੁਐਰੀ (query) ਕਰਦੇ ਹਨ, ਤਾਂ ਪੈਰਲਲ ਫਾਇਦਾ ਘਟ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸਟੈਂਡਰਡ autoregressive ਵਿਧੀ ਸਮੁੱਚੀ ਥਰੂਪੁੱਟ (throughput) ਵਿੱਚ ਬਰਾਬਰ ਆ ਜਾਂਦੀ ਹੈ।
ਹਰੇਕ ਪਹੁੰਚ ਕਿੱਥੇ ਢੁਕਵੀਂ ਹੈ
ਡਾਟਾ ਇੱਕ ਹਾਈਬ੍ਰਿਡ ਡਿਪਲਾਈਮੈਂਟ ਰਣਨੀਤੀ ਦਾ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ:
- Diffusion models: ਘੱਟ-ਕੰਕਰੈਂਸੀ (low-concurrency) ਅਤੇ ਲੇਟੈਂਸੀ-ਸੰਵੇਦਨਸ਼ੀਲ ਕੰਮਾਂ ਲਈ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਡੂੰਘੇ ਤਰਕ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ—ਜਿਵੇਂ ਕਿ ਛੋਟੇ ਪ੍ਰੋਂਪਟ ਜਨਰੇਟ ਕਰਨਾ, ਟੈਂਪਲੇਟ ਭਰਨਾ, ਜਾਂ ਡਰਾਫਟ ਟੈਕਸਟ ਤਿਆਰ ਕਰਨਾ।
- Autoregressive models: ਉੱਚ-ਕੰਕਰੈਂਸੀ ਵਰਕਲੋਡ, ਗੁੰਝਲਦਾਰ ਤਰਕ, ਜਾਂ ਲੰਬੇ ਰੂਪ ਵਿੱਚ ਜਨਰੇਸ਼ਨ ਲਈ ਜਿੱਥੇ ਸਹੀ ਹੋਣਾ ਰਫ਼ਤਾਰ ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਇਸ ਤਬਦੀਲੀ ਦਾ AI ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਲਈ ਕੀ ਮਤਲਬ ਹੈ
ਜੇਕਰ ਮਾਡਲ ਦੇ ਆਕਾਰ ਨੂੰ ਵਧਾਉਣ ਦੀ ਬਜਾਏ ਜਨਰੇਸ਼ਨ ਐਲਗੋਰਿਦਮ ਨੂੰ ਦੁਬਾਰਾ ਸੋਚ ਕੇ ਰਫ਼ਤਾਰ ਦਾ ਲਾਭ ਉਠਾਇਆ ਜਾ ਸਕਦਾ ਹੈ, ਤਾਂ ਸਭ ਤੋਂ ਵੱਡੀ ਕੁਸ਼ਲਤਾ "ਪਲੰਬਿੰਗ" (plumbing) ਸੁਧਾਰਾਂ ਤੋਂ ਆ ਸਕਦੀ ਹੈ। ਇਸ ਤਬਾਦਲੇ ਦਾ ਮਤਲਬ ਇਹ ਵੀ ਹੈ ਕਿ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕੁਝ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਵਿੱਚ ਗੁਣਵੱਤਾ ਵਿੱਚ ਮਾਮੂਲੀ ਗਿਰਾਵਟ ਨੂੰ ਸਵੀਕਾਰ ਕਰਨਾ ਪਵੇਗਾ।
ਵਿਰੋਧੀ ਪੱਖ: ਕੀ ਡਿਫਿਊਜ਼ਨ ਮੁੱਖ ਧਾਰਾ ਲਈ ਤਿਆਰ ਹੈ?
ਡਿਫਿਊਜ਼ਨ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨ ਛੋਟੇ ਪ੍ਰੋਂਪਟ ਨਾਲ ਸੰਘਰਸ਼ ਕਰਦੀ ਹੈ ਅਤੇ ਅਸਥਿਰ (jittery) ਆਉਟਪੁੱਟ ਦੇ ਸਕਦੀ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- Scaling studies: ਕੀ ਵੱਡੇ ਡਿਫਿਊਜ਼ਨ ਮਾਡਲ ਰਫ਼ਤਾਰ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਕਾਬਲੀਅਤ ਦੇ ਪਾੜੇ ਨੂੰ ਖਤਮ ਕਰਨਗੇ?
- Hardware optimizations: ਜਿਵੇਂ-ਜਿਵੇਂ GPU ਵਿਕਸਿਤ ਹੁੰਦੇ ਹਨ, ਕੰਪਿਊਟ-ਭਾਰੀ ਡਿਫਿਊਜ਼ਨ ਸਟੈਪਸ ਅਤੇ ਵੇਟ-ਭਾਰੀ autoregression ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਫਿਰ ਤੋਂ ਬਦਲ ਸਕਦਾ ਹੈ।
- Routing algorithms: ਟਾਸਕ-ਅਵੇਅਰ ਮਾਡਲ ਰਾਊਟਰਾਂ ਦੇ ਸ਼ੁਰੂਆਤੀ ਪ੍ਰੋਟੋਟਾਈਪ ਇਹ ਦੱਸਣਗੇ ਕਿ ਡਾਇਨਾਮਿਕ ਚੋਣ ਰਾਹੀਂ ਸਮੁੱਚੀ ਸਿਸਟਮ ਲੇਟੈਂਸੀ ਨੂੰ ਕਿੰਨਾ ਘਟਾਇਆ ਜਾ ਸਕਦਾ ਹੈ।
ਸਿੱਟਾ
DiffusionGemma ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਬੁਨਿਆਦੀ ਜਨਰੇਸ਼ਨ ਲੂਪ ਨੂੰ ਦੁਬਾਰਾ ਸੋਚਣ ਨਾਲ ਵਧੇਰੇ ਚਿਪਸ ਜੋੜੇ ਬਿਨਾਂ ਲੇਟੈਂਸੀ ਨੂੰ ਘਟਾਇਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਤਕਨਾਲੋਜੀ autoregressive ਮਾਡਲਾਂ ਦਾ ਪੂਰਨ ਬਦਲ ਨਹੀਂ ਹੈ, ਪਰ ਇਹ ਇੱਕ ਹਾਈਬ੍ਰਿਡ AI ਸਟੈਕ ਲਈ ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸਾਧਨ ਪੇਸ਼ ਕਰਦੀ ਹੈ ਜਿੱਥੇ ਰਫ਼ਤਾਰ ਅਤੇ ਸਹੀ ਹੋਣ ਦੇ ਵਿਚਕਾਰ ਹਰੇਕ ਕੰਮ ਦੇ ਅਧਾਰ 'ਤੇ ਸੰਤੁਲਨ ਬਣਾਇਆ ਜਾਂਦਾ ਹੈ। AI ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਦੀ ਅਗਲੀ ਲਹਿਰ ਦਾ ਫੈਸਲਾ ਸ਼ਾਇਦ ਸਿਰਫ ਮਾਡਲ ਦੇ ਆਕਾਰ ਨਾਲ ਨਹੀਂ, ਸਗੋਂ ਇਸ ਗੱਲ ਨਾਲ ਕੀਤਾ ਜਾਵੇਗਾ ਕਿ ਇਹ ਕੰਮ ਨੂੰ ਸਹੀ ਕਿਸਮ ਦੇ ਇੰਜਣ ਰਾਹੀਂ ਕਿੰਨੀ ਚਲਾਕੀ ਨਾਲ ਰਾਊਟ ਕਰਦਾ ਹੈ।
