OpenAI ਨੇ ਆਪਣਾ ਖੁਦ ਦਾ ਇਨਫਰੈਂਸ (inference) ਚਿੱਪ, Jalapeño, ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਅਤੇ ਕਿਹਾ ਹੈ ਕਿ ਇਹ Nvidia ਦੇ GB200 ਅਤੇ GB300 ਐਕਸਲਰੇਟਰਾਂ ਦੇ ਮੁਕਾਬਲੇ ਪ੍ਰਤੀ ਕਿਲੋਵਾਟ 1.9 × ਤੱਕ ਜ਼ਿਆਦਾ ਥਰੂਪੁੱਟ (throughput) ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਟੀਮ ਨੇ ਨੌਂ ਮਹੀਨਿਆਂ ਵਿੱਚ ਇੱਕ ਸੰਕਲਪ ਨੂੰ ਕੰਮ ਕਰਦੇ ਸਿਲੀਕਾਨ ਡਾਈ (silicon die) ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ—ਜੋ ਕਿ ਕਸਟਮ AI ਪ੍ਰੋਸੈਸਰਾਂ ਲਈ ਆਮ ਦੋ ਤੋਂ ਤਿੰਨ ਸਾਲ ਦੇ ਚੱਕਰ ਨਾਲੋਂ ਕਿਤੇ ਜ਼ਿਆਦਾ ਤੇਜ਼ ਹੈ।
ਇਹ ਤੇਜ਼ ਰਫ਼ਤਾਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
OpenAI ਹੁਣ ਸਿਰਫ਼ Nvidia GPUs 'ਤੇ ਨਿਰਭਰ ਰਹਿਣ ਦੀ ਬਜਾਏ Cerebras, AWS Trainium, AMD ਅਤੇ ਹੋਰਾਂ ਦੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਮਾਡਲ ਚਲਾਉਂਦਾ ਹੈ। ਜਿਵੇਂ-ਜਿਵੇਂ AI ਟ੍ਰੇਨਿੰਗ-ਭਾਰੀ (training-heavy) ਤੋਂ ਇਨਫਰੈਂਸ-ਭਾਰੀ (inference-heavy) ਵਰਕਲੋਡ ਵੱਲ ਵਧ ਰਿਹਾ ਹੈ, ਬਿਜਲੀ ਦੀ ਵਰਤੋਂ ਅਤੇ ਪ੍ਰਤੀ ਕੁਐਰੀ (query) ਲਾਗਤ ਨਿਰਣਾਇਕ ਹੋ ਜਾਂਦੀ ਹੈ। ਇੱਕ ਅਜਿਹਾ ਚਿੱਪ ਜੋ ਇੱਕ ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਲਈ ਲੋੜੀਂਦੀ ਊਰਜਾ ਨੂੰ ਅੱਧਾ ਕਰ ਦਿੰਦਾ ਹੈ, ਉਹ ਰੋਜ਼ਾਨਾ ਅਰਬਾਂ ਰਿਕਵੈਸਟਾਂ ਨੂੰ ਸੰਭਾਲਣ ਵਾਲੀਆਂ ਸੇਵਾਵਾਂ ਲਈ ਸੰਚਾਲਨ ਖਰਚਿਆਂ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ।
AI ਨੇ ਚਿੱਪ ਕਿਵੇਂ ਲਿਖੀ
Jalapeño ਇੱਕ ASIC ਹੈ—ਇੱਕ ਅਜਿਹਾ ਚਿੱਪ ਜੋ ਇੱਕੋ ਮਕਸਦ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ: Large Language Models (LLM) ਨੂੰ ਚਲਾਉਣਾ। ਇੱਕ ਜਨਰਲ-ਪਰਪਜ਼ GPU ਦੇ ਉਲਟ, ਇੱਕ ASIC ਬੇਲੋੜੀ ਲੌਜਿਕ ਨੂੰ ਹਟਾ ਦਿੰਦਾ ਹੈ ਅਤੇ ਡੇਟਾ ਪਾਥਾਂ ਨੂੰ LLM ਇਨਫਰੈਂਸ ਪੈਟਰਨਾਂ ਅਨੁਸਾਰ ਤਿਆਰ ਕਰਦਾ ਹੈ। OpenAI ਦੇ ਇੰਜੀਨੀਅਰਾਂ ਨੇ ਇਸ ਡਿਜ਼ਾਈਨ ਨੂੰ XLS ਵਿੱਚ ਲਿਖਿਆ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਹਾਰਡਵੇਅਰ ਡਿਸਕ੍ਰਿਪਸ਼ਨ ਭਾਸ਼ਾ ਹੈ ਜੋ ਮਸ਼ੀਨ-ਲਰਨਿੰਗ ਮਾਡਲਾਂ ਨੂੰ ਕੋਡ ਬਣਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ। ਕੰਪਨੀ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ AI-ਜਨਰੇਟਡ ਲੌਜਿਕ ਚਿੱਪ ਦੇ ਕੋਰ ਦਾ ਅੱਧੇ ਤੋਂ ਵੱਧ ਹਿੱਸਾ ਹੈ, ਜਿਸ ਨਾਲ ਡਿਜ਼ਾਈਨ ਪਾਈਪਲਾਈਨ ਸਾਲਾਂ ਤੋਂ ਘਟ ਕੇ ਮਹੀਨਿਆਂ ਵਿੱਚ ਆ ਗਈ ਹੈ।
ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਦਾਅਵਾ ਬਨਾਮ ਹਕੀਕਤ
OpenAI ਨੇ Jalapeño ਲਈ ਤਿੰਨ ਮੁੱਖ ਅੰਕੜੇ ਦਿੱਤੇ ਹਨ:
- ਪ੍ਰਤੀ ਕਿਲੋਵਾਟ ਥਰੂਪੁੱਟ (Throughput): Nvidia ਦੇ GB200/GB300 ਨਾਲੋਂ 1.5 – 1.9 × ਜ਼ਿਆਦਾ।
- ਲੇਟੈਂਸੀ (Latency): ਉਹੀ Nvidia ਮਾਡਲਾਂ ਨਾਲੋਂ 1.7 – 3.6 × ਘੱਟ।
- 1-ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ 'ਤੇ ਪਾਵਰ ਦੀ ਖਪਤ: GB300 'ਤੇ 1,400 W ਦੇ ਮੁਕਾਬਲੇ 700 W।
ਜੇਕਰ ਇਹ ਅੰਕੜੇ ਸਹੀ ਸਾਬਤ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਇੱਕ ਡੇਟਾ ਸੈਂਟਰ ਤੇਜ਼ ਜਵਾਬ ਦੇਣ ਦੇ ਨਾਲ-ਨਾਲ ਅੱਧੀ ਬਿਜਲੀ ਦੀ ਲਾਗਤ 'ਤੇ ਉਹੀ ਮਾਡਲ ਚਲਾ ਸਕਦਾ ਹੈ। ਇਹ ਦਾਅਵੇ ਇਨਫਰੈਂਸ 'ਤੇ ਕੇਂਦਰਿਤ ਹਨ; OpenAI ਟ੍ਰੇਨਿੰਗ ਪ੍ਰਦਰਸ਼ਨ ਬਾਰੇ ਕੋਈ ਗੱਲ ਨਹੀਂ ਕਰਦਾ, ਜੋ ਕਿ ਚੈਟ-ਕਿਸਮ ਦੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਸੇਵਾ ਪ੍ਰਦਾਨ ਕਰਨ ਦੇ ਇਸਦੇ ਮੌਜੂਦਾ ਜ਼ੋਰ ਦੇ ਅਨੁਕੂਲ ਹੈ।
ਇਸਦਾ Nvidia ਲਈ ਕੀ ਮਤਲਬ ਹੈ
Nvidia ਦੇ ਆਉਣ ਵਾਲੇ Blackwell ਅਤੇ Vera Rubin ਚਿੱਪ ਉੱਚ-ਅਧਿਕਾਰ (high-end) ਐਕਸਲਰੇਟਰ ਮਾਰਕੀਟ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੇ ਹਨ। Nvidia ਦਾ ਫਾਇਦਾ ਇੱਕ ਪਰਿਪੱਕ (mature) ਸਾਫਟਵੇਅਰ ਸਟੈਕ, ਵਿਆਪਕ ਡਿਵੈਲਪਰ ਅਪਣਾਅ, ਅਤੇ AI ਕਾਰਜਾਂ ਵਿੱਚ ਲਚਕਤਾ ਵਿੱਚ ਹੈ। ਇਸਦੇ ਉਲਟ, Jalapeño ਇੱਕ ਸੀਮਤ-ਮਕਸਦ ਵਾਲਾ ਯੰਤਰ ਹੈ ਜੋ ਕੇਵਲ ਉਦੋਂ ਜਿੱਤਦਾ ਹੈ ਜਦੋਂ ਵਰਕਲੋਡ ਇਸਦੀ ਵਿਸ਼ੇਸ਼ਤਾ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੋਵੇ।
Nvidia 'ਤੇ ਦਬਾਅ ਦੇ ਦੋ ਪਹਿਲੂ ਹਨ। ਪਹਿਲਾ, ਉਹ ਗਾਹਕ ਜੋ ਇੱਕ ਕਸਟਮ ASIC ਦਾ ਖਰਚਾ ਚੁੱਕ ਸਕਦੇ ਹਨ, ਵਾਅਦੇ ਕੀਤੇ ਬਚਾਅ ਲਈ ਬਦਲ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ Nvidia ਦੇ ਇਨਫਰੈਂਸ ਹਿੱਸੇ ਵਿੱਚ ਕਮੀ ਆ ਸਕਦੀ ਹੈ। ਦੂਜਾ, ਇਹ ਪ੍ਰਦਰਸ਼ਨ ਕਿ AI ਹਾਰਡਵੇਅਰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ, ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੇ ਵਿਕਾਸ ਚੱਕਰਾਂ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ Nvidia ਨੂੰ ਆਪਣੇ ਰੋਡਮੈਪ ਨੂੰ ਤੇਜ਼ ਕਰਨ ਲਈ ਮਜਬੂਰ ਹੋਣਾ ਪਵੇਗਾ।
ਵਿਰੋਧੀ-ਬਿੰਦੂ ਅਤੇ ਖੁੱਲ੍ਹੇ ਸਵਾਲ
- ਸਾਫਟਵੇਅਰ ਈਕੋਸਿਸਟਮ (Software ecosystem): Nvidia ਦੀਆਂ CUDA ਲਾਇਬ੍ਰੇਰੀਆਂ, ਪ੍ਰੋਫਾਈਲਿੰਗ ਟੂਲਜ਼, ਅਤੇ ਕਮਿਊਨਿਟੀ ਸਪੋਰਟ ਅਜੇ ਵੀ ਜ਼ਿਆਦਾਤਰ ਡਿਵੈਲਪਰਾਂ ਲਈ ਇਸਨੂੰ ਇੱਕ ਨਿਰਣਾਇਕ ਵਾਧੂ ਫਾਇਦਾ ਦਿੰਦੀਆਂ ਹਨ। Jalapeño ਨੂੰ ਜੋੜਨ ਲਈ ਨਵੇਂ ਟੂਲਚੇਨਾਂ ਅਤੇ ਸ਼ਾਇਦ ਕੋਡ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖਣ ਦੀ ਲੋੜ ਪਵੇਗੀ।
- ਅਸਲ-ਦੁਨੀਆ ਦੀ ਪੁਸ਼ਟੀ (Real-world validation): ਇਹ ਅੰਕੜੇ OpenAI ਦੇ ਅੰਦਰੂਨੀ ਟੈਸਟਾਂ ਤੋਂ ਆਏ ਹਨ। ਸੁਤੰਤਰ ਬੈਂਚਮਾਰਕ, ਲੰਬੇ ਸਮੇਂ ਦੀ ਭਰੋਸੇਯੋਗਤਾ ਦਾ ਡੇਟਾ, ਅਤੇ ਮਿਕਸਡ-ਟੈਂੈਂਟ ਲੋਡਾਂ ਦੇ ਅਧੀਨ ਸਕੈਲਿੰਗ ਵਿਵਹਾਰ ਅਜੇ ਤੱਕ ਅਣਪਛਾਤੇ ਹਨ।
- ਪੈਮਾਨੇ ਦੀ ਅਰਥ ਸ਼ਾਸਤਰ (Economics of scale): ਇੱਕ ASIC ਦਾ ਲਾਗਤ ਫਾਇਦਾ ਮਾਤਰਾ (volume) ਦੇ ਨਾਲ ਵਧਦਾ ਹੈ। OpenAI ਦੀ ਅੰਦਰੂਨੀ ਵਰਤੋਂ ਨਿਵੇਸ਼ ਨੂੰ ਜਾਇਜ਼ ਠਹਿਰਾ ਸਕਦੀ ਹੈ, ਪਰ ਬਾਹਰੀ ਗਾਹਕਾਂ ਨੂੰ ਉੱਚੀਆਂ ਪ੍ਰਤੀ-ਚਿੱਪ ਕੀਮਤਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪੈ ਸਕਦਾ ਹੈ ਜਦੋਂ ਤੱਕ ਉਤਪਾਦਨ ਦਾ ਪੈਮਾਨਾ ਨਹੀਂ ਵਧਦਾ।
ਅੱਗੇ ਵੱਲ ਦੇਖਦੇ ਹੋਏ
ਫਿਲਹਾਲ ਲਈ, Jalapeño ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਨੌਂ ਮਹੀਨਿਆਂ ਦੀ ਤੇਜ਼ ਰਫ਼ਤਾਰ ਇੱਕ ਅਜਿਹਾ ਚਿੱਪ ਤਿਆਰ ਕਰ ਸਕਦੀ ਹੈ ਜੋ, ਕਾਗਜ਼ੀ ਤੌਰ 'ਤੇ, AI ਸਟੈਕ ਦੇ ਸਭ ਤੋਂ ਲਾਗਤ-ਸੰਵੇਦਨਸ਼ੀਲ ਹਿੱਸੇ ਵਿੱਚ ਮੌਜੂਦਾ GPU ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ। ਅਸਲ ਟੈਸਟ ਇਹ ਹੋਵੇਗਾ ਕਿ ਕੀ ਉਹ ਫਾਇਦਾ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਵਰਕਲੋਡਾਂ ਦੀ ਸਖ਼ਤੀ ਵਿੱਚ ਟਿਕ ਸਕਦਾ ਹੈ।
