OpenAI ਦੇ ਨਵੇਂ Jalapeño inference ਚਿੱਪ ਨੇ InferenceX ਬੈਂਚਮਾਰਕ 'ਤੇ Nvidia ਦੇ Blackwell ਨੂੰ ਪਛਾੜ ਦਿੱਤਾ ਹੈ, ਜੋ ਕਿ ਪ੍ਰਤੀ ਵਾਟ 1.5 × ਤੋਂ 1.9 × ਵਧੇਰੇ AI ਕੰਮ ਅਤੇ ਕਾਫ਼ੀ ਘੱਟ ਲੇਟੈਂਸੀ (latency) ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਇਹ ਨਤੀਜਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਵੱਡੇ ਪੱਧਰ ਦੀਆਂ ਭਾਸ਼ਾ-ਮਾਡਲ ਸੇਵਾਵਾਂ ਦੀ ਸੰਚਾਲਨ ਲਾਗਤ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ ਅਤੇ AI accelerators ਵਿੱਚ Nvidia ਦੇ ਦਬਦਬੇ 'ਤੇ ਦਬਾਅ ਪਾ ਸਕਦਾ ਹੈ।
ਇਹ ਚਿੱਪ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
OpenAI ਨੇ Hot Chips 2026 ਕਾਨਫਰੰਸ ਵਿੱਚ Jalapeño ਦਾ अनाਹਵਨ ਕੀਤਾ ਅਤੇ ਸਿਲੀਕਾਨ 'ਤੇ Broadcom ਨਾਲ ਭਾਈਵਾਲੀ 'ਤੇ ਜ਼ੋਰ ਦਿੱਤਾ। ਡਿਜ਼ਾਈਨਰਾਂ ਨੇ ਮੌਜੂਦਾ inference pipelines ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਡੀਆਂ ਅਕੁਸ਼ਲਤਾਵਾਂ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਇਆ ਹੈ: prefill ਸਟੇਜ ਦੌਰਾਨ ਡਾਟਾ ਦੀ ਹਰਕਤ ਅਤੇ compute units ਵਿਚਕਾਰ ਸੰਚਾਰ। Key-value (KV) cache ਨੂੰ ਸਥਾਨਕ (local) ਰੱਖ ਕੇ, Jalapeño tensors ਨੂੰ ਹਿਲਾਉਣ-ਜੁਲਾਉਣ ਵਿੱਚ ਲੱਗੇ ਸਮੇਂ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਜੋ ਕਿ token generation ਨੂੰ ਤੇਜ਼ ਕਰਦਾ ਹੈ ਅਤੇ ਊਰਜਾ ਬਚਾਉਂਦਾ ਹੈ।
ਖਾਸ ਅੰਕੜੇ
- ਪ੍ਰਤੀ ਵਾਟ AI ਕੰਮ: Blackwell ਦੇ ਮੁਕਾਬਲੇ ਪੀਕ throughput 'ਤੇ 1.5 × ਤੋਂ 1.9 × ਵਧੇਰੇ।
- Latency: 1.7 × ਤੋਂ 3.6 × ਘੱਟ, ਤਾਂ ਜੋ ਇੰਟਰਐਕਟਿਵ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਜਵਾਬ ਤੇਜ਼ੀ ਨਾਲ ਮਿਲ ਸਕਣ।
- Interactive workload performance: 2.1 × ਤੋਂ 4.1 × ਵਧੇਰੇ, ਇੱਕ ਅਜਿਹਾ ਵਾਧਾ ਜੋ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਚੈਟ-ਸਟਾਈਲ ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ।
ਇਹ ਵਾਧਾ InferenceX ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਦੇਖਣ ਨੂੰ ਮਿਲਦਾ ਹੈ, ਜਿੱਥੇ Jalapeño ਨੇ Nvidia ਦੇ ਆਉਣ ਵਾਲੇ Rubin ਚਿੱਪਸ ਨੂੰ ਵੀ ਹਰਾ ਦਿੱਤਾ ਹੈ।
ਵਪਾਰਕ ਪ੍ਰਭਾਵ
OpenAI ਪਹਿਲਾਂ ਹੀ ਆਪਣੀ GPT-5.6 Sol API ਦੀਆਂ ਕੀਮਤਾਂ ਘਟਾਉਣ ਲਈ ਕੁਸ਼ਲਤਾ ਦੇ ਵਾਧੇ ਦੀ ਵਰਤੋਂ ਕਰ ਰਿਹਾ ਹੈ, ਜੋ ਪਿਛਲੀਆਂ ਦਰਾਂ ਦੇ ਮੁਕਾਬਲੇ 20% ਤੋਂ 33% ਤੱਕ ਦੀ ਛੋਟ ਪੇਸ਼ ਕਰ ਰਿਹਾ ਹੈ। ਘੱਟ ਬਿਜਲੀ ਦੀ ਖਪਤ ਵਿਸ਼ਾਲ inference clusters ਨੂੰ ਚਲਾਉਣ ਦੀ ਲਾਗਤ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਜਿਸਦਾ ਫਾਇਦਾ ਡਿਵੈਲਪਰ ਅਤੇ ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ ਮਹਿਸੂਸ ਕਰ ਸਕਦੇ ਹਨ।
ਸਮਾਂ ਅਤੇ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਦਬਾਅ
Jalapeño 2026 ਦੇ ਅੰਤ ਤੱਕ ਸੀਮਤ ਮਾਤਰਾ ਵਿੱਚ ਸ਼ਿਪ ਕੀਤਾ ਜਾਵੇਗਾ, ਜਦਕਿ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਉਤਪਾਦਨ 2027 ਲਈ ਨਿਰਧਾਰਤ ਹੈ। ਉਦੋਂ ਤੱਕ Nvidia ਨੂੰ ਨਵੀਆਂ GPU ਪੀੜ੍ਹੀਆਂ ਦੀ ਉਮੀਦ ਹੈ, ਜੋ ਇਸ ਪਾੜੇ ਨੂੰ ਘਟਾ ਸਕਦੀਆਂ ਹਨ। ਇਹ ਕ੍ਰਮਵਾਰ ਰੋਲਆਊਟ OpenAI ਨੂੰ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੁਆਰਾ ਨਵਾਂ ਸਿਲੀਕਾਨ ਲਿਆਂਦੇ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਅਸਲ ਦੁਨੀਆ ਦੇ ਲਾਭਾਂ ਨੂੰ ਸਾਬਤ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।
ਵਿਰੋਧੀ ਪੱਖ
ਉਦੋਂ ਤੱਕ ਸੰਭਵ ਤੌਰ 'ਤੇ Nvidia ਦੇ ਨਵੇਂ ਚਿੱਪਸ ਬਾਜ਼ਾਰ ਵਿੱਚ ਹੋਣਗੇ।
ਕੀ ਦੇਖਣਾ ਹੈ
- Deployment data: ਲੇਟੈਂਸੀ ਅਤੇ ਬਿਜਲੀ ਦੀ ਬਚਤ 'ਤੇ ਸ਼ੁਰੂਆਤੀ ਗਾਹਕਾਂ ਦਾ ਫੀਡਬੈਕ ਇਹ ਦਿਖਾਏਗਾ ਕਿ ਕੀ ਬੈਂਚਮਾਰਕ ਅੰਕੜੇ ਉਤਪਾਦਨ (production) ਵਿੱਚ ਵੀ ਟਿਕਦੇ ਹਨ।
- Pricing strategy: API ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਲਗਾਤਾਰ ਕਟੌਤੀ ਹੋਣ ਨਾਲ ਹੋਰ ਪ੍ਰਦਾਤਾ ਸਮਾਨ ਹਾਰਡਵੇਅਰ ਵੱਲ ਵਧ ਸਕਦੇ ਹਨ ਜਾਂ ਮਾਰਕੀਟ ਹਿੱਸਾ ਗਵਾਉਣ ਦਾ ਖਤਰਾ ਹੋ ਸਕਦਾ ਹੈ।
- Nvidia’s roadmap: ਕਿਸੇ ਨਵੇਂ inference-focused accelerator ਦੀ ਕੋਈ ਵੀ ਘੋਸ਼ਣਾ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦੀ ਗਤੀਸ਼ੀਲਤਾ ਨੂੰ ਮੁੜ ਸੁਰਜੀਤ ਕਰੇਗੀ।
OpenAI ਦਾ ਫੁੱਲ-ਸਟੈਕ ਪਹੁੰਚ—ਮਾਡਲਾਂ, ਚਿੱਪਸ ਅਤੇ ਮੈਮੋਰੀ ਨੂੰ ਇਕੱਠੇ ਬਣਾਉਣਾ—ਉਸਨੂੰ ਇੱਕ ਅਜਿਹਾ ਲੀਵਰ (lever) ਦਿੰਦਾ ਹੈ ਜੋ ਸਟੈਂਡਰਡ accelerators ਕੋਲ ਨਹੀਂ ਹੈ। ਕੀ ਉਹ ਲੀਵਰ ਇੱਕ ਸਥਾਈ ਮਾਰਕੀਟ ਤਬਦੀਲੀ ਵਿੱਚ ਬਦਲਦਾ ਹੈ, ਇਹ ਇਸ ਗੱਲ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ ਕਿ Jalapeño ਚਿੱਪ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰੋਟੋਟਾਈਪ ਤੋਂ ਵਿਆਪਕ ਵਰਤੋਂ ਵਿੱਚ ਆਉਂਦੀ ਹੈ ਅਤੇ Nvidia ਕੁਸ਼ਲਤਾ ਦੀ ਚੁਣੌਤੀ ਦਾ ਕਿਵੇਂ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
