ਬੈਂਚਮਾਰਕ ਦੀਆਂ ਮੁੱਖ ਗੱਲਾਂ

Hot Chips ਕਾਨਫਰੰਸ ਨੇ ਉਹ ਅੰਕੜੇ ਪ੍ਰਗਟ ਕੀਤੇ ਹਨ ਜਿਨ੍ਹਾਂ ਦੀ ਇੱਕ ਸੁਤੰਤਰ ਫਰਮ ਨੇ InferenceX ਸੂਟ ਨਾਲ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ। OpenAI Jalapeño ਨੂੰ ਇੱਕ ਜਨਰਲ-ਪਰਪਜ਼ ਇਨਫਰੈਂਸ ਐਕਸਲਰੇਟਰ (general-purpose inference accelerator) ਕਹਿੰਦਾ ਹੈ—ਇਹ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ ਪਰ ਉਹਨਾਂ ਨੂੰ ਟ੍ਰੇਨ ਨਹੀਂ ਕਰਦਾ। ਟੈਸਟਾਂ ਵਿੱਚ ਚਿੱਪ:

  • ਅੱਜ ਦੇ ਲੀਡਰਾਂ ਦੇ ਮੁਕਾਬਲੇ ਪੀਕ ਥਰੂਪੁੱਟ (peak throughput) 'ਤੇ ਪਰ ਵਾਟ 1.5 × ਤੋਂ 1.9 × ਵੱਧ ਕੰਮ ਦਿੱਤਾ।
  • ਲੇਟੈਂਸੀ (latency) ਨੂੰ 1.7 × ਤੋਂ 3.6 × ਤੱਕ ਘਟਾਇਆ, ਜਿਸ ਨਾਲ ਇੰਟਰਐਕਟਿਵ ਲਾਭ 2.1 × ਤੋਂ 4.1 × ਤੱਕ ਹੋਏ।

ਮਾਡਲ-ਵਿਸ਼ੇਸ਼ ਨਤੀਜੇ:

  • GPT-OSS 120B: ~1,400 ਟੋਕਨ/ਸੈਕੰਡ/ਯੂਜ਼ਰ।
  • Deepseek R1 670B: ਇੱਕ ਸਿੰਗਲ ਕੰਕਰੈਂਟ ਰਿਕਵੈਸਟ 'ਤੇ ~700 ਟੋਕਨ/ਸੈਕੰਡ।
  • Kimi K2.5 1T: ਹਾਈ-ਪਰਫਾਰਮੈਂਸ ਸੂਟ ਵਿੱਚ ਟੈਸਟ ਕੀਤਾ ਗਿਆ (ਸਹੀ ਅੰਕੜੇ ਗੁਪਤ ਰੱਖੇ ਗਏ ਹਨ)।

OpenAI ਨੇ ਇਸ ਗੱਲ 'ਤੇ ਜ਼ੋਰ ਦਿੱਤਾ ਕਿ ਇਹ ਅੰਕੜੇ ਸਪੈਕੂਲੇਟਿਵ ਡੀਕੋਡਿੰਗ (speculative decoding) ਜਾਂ ਮਲਟੀ-ਟੋਕਨ ਪ੍ਰੀਡਿਕਸ਼ਨ (multi-token prediction) ਤੋਂ ਬਿਨਾਂ ਆਏ ਹਨ—ਜੋ ਕਿ ਉਹ ਤਰੀਕੇ ਹਨ ਜੋ ਕਈ ਵਿਰੋਧੀਆਂ ਦੁਆਰਾ ਮੁੱਖ ਅੰਕੜਿਆਂ ਨੂੰ ਵਧਾਉਣ ਲਈ ਵਰਤੇ ਜਾਂਦੇ ਹਨ।

Jalapeño ਕਿਵੇਂ ਬਣਾਇਆ ਗਿਆ

OpenAI ਨੇ Broadcom ਨਾਲ ਮਿਲ ਕੇ ਨੌਂ ਮਹੀਨਿਆਂ ਵਿੱਚ ਚਿੱਪ ਦਾ ਡਿਜ਼ਾਈਨ ਪੂਰਾ ਕੀਤਾ। ਫਰਮ ਨੇ ਡਿਜ਼ਾਈਨ ਲੂਪ ਵਿੱਚ ਆਪਣੇ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਜਿਸ ਨਾਲ ਬਲੂਪ੍ਰਿੰਟਿੰਗ, ਪ੍ਰੋਗਰਾਮਿੰਗ ਅਤੇ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਦੀ ਰਫ਼ਤਾਰ ਵਧ ਗਈ—ਇਸ ਵਿਧੀ ਨੂੰ "AI-assisted silicon design" ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਇਹ ਤੇਜ਼ੀ ਨਾਲ ਕੀਤਾ ਗਿਆ ਕੰਮ ਹਾਈ-ਪਰਫਾਰਮੈਂਸ ਸਿਲੀਕਾਨ ਦੇ ਪੁਰਾਣੇ ਕਈ ਸਾਲਾਂ ਦੇ ਚੱਕਰਾਂ ਤੋਂ ਇੱਕ ਵੱਡੇ ਬਦਲਾਅ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।

Nvidia ਦੀ ਲੀਡ ਲਈ ਪ੍ਰਭਾਵ

Nvidia ਆਪਣੀ ਸ਼ਕਤੀ ਰੌਅ ਪਰਫਾਰਮੈਂਸ (raw performance) ਅਤੇ CUDA ਈਕੋਸਿਸਟਮ 'ਤੇ ਟਿਕਾਈ ਹੋਈ ਹੈ। ਨਵਾਂ ਡੇਟਾ ਇਸ ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਫਾਇਦੇ ਨੂੰ ਚੁਣੌਤੀਪੂਰਨ ਬਣਾਉਂਦਾ ਹੈ। ਵਿਸ਼ਲੇਸ਼ਕਾਂ ਨੇ ਚੇਤਾਵਨੀ ਦਿੱਤੀ ਹੈ ਕਿ ਜੇਕਰ ਹੋਰ AI ਫਰਮਾਂ ਇਸੇ ਤਰ੍ਹਾਂ ਦੀ ਕੁਸ਼ਲਤਾ ਵਾਲੇ ਕਸਟਮ ਇਨਫਰੈਂਸ ਸਿਲੀਕਾਨ ਲਾਂਚ ਕਰਦੀਆਂ ਹਨ, ਤਾਂ ਡਿਵੈਲਪਰ CUDA ਤੋਂ ਦੂਰ ਜਾ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਵਿਕਲਪਿਕ ਸਟੈਕਸ ਅਤੇ ਇੱਕ ਖੰਡਿਤ (fragmented) ਬਾਜ਼ਾਰ ਲਈ ਜਗ੍ਹਾ ਬਣੇਗੀ।

OpenAI ਦੀ ਮਿਕਸਡ-ਸਿਗਨਲ ਰਣਨੀਤੀ

ਚੀਫ਼ ਫਾਈਨੈਂਸ਼ੀਅਲ ਅਫਸਰ Kelly Huang ਨੇ Jalapeño ਨੂੰ ਇੱਕ ਵਿਆਪਕ ਕੰਪਿਊਟ ਯੋਜਨਾ ਦੇ ਇੱਕ ਹਿੱਸੇ ਵਜੋਂ ਪੇਸ਼ ਕੀਤਾ, ਨਾ ਕਿ ਮੌਜੂਦਾ ਭਾਈਵਾਲਾਂ ਦੇ ਪੂਰਨ ਬਦਲ ਵਜੋਂ। OpenAI ਅਜੇ ਵੀ ਵੱਖ-ਵੱਖ ਵਰਕਲੋਡਸ ਲਈ Nvidia, AMD, AWS ਅਤੇ Cerebras ਨਾਲ ਕੰਮ ਕਰ ਰਿਹਾ ਹੈ। Jalapeño ਅਜੇ ਇੱਕ ਇੰਜੀਨੀਅਰਿੰਗ ਸੈਂਪਲ ਹੈ; ਇਸ ਨੇ ਅਜੇ ਤੱਕ Deepseek V4 Pro ਵਰਗੇ ਵੱਡੇ ਆਉਣ ਵਾਲੇ ਮਾਡਲਾਂ ਦਾ ਸਾਹਮਣਾ ਨਹੀਂ ਕੀਤਾ ਹੈ। Huang ਦੀਆਂ ਟਿੱਪਣੀਆਂ ਤੋਂ ਸੰਕੇਤ ਮਿਲਦਾ ਹੈ ਕਿ OpenAI ਹਰ ਕੰਮ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਲਾਗਤ-ਪ੍ਰਦਰਸ਼ਨ (cost-performance) ਮਿਸ਼ਰਣ ਦੀ ਭਾਲ ਵਿੱਚ ਆਪਣੇ ਸਿਲੀਕਾਨ ਨੂੰ ਤੀਜੀ-ਧਿਰ ਦੇ ਐਕਸਲਰੇਟਰਾਂ ਨਾਲ ਮਿਲਾਏਗਾ।

ਵਿਰੋਧੀ ਵਿਚਾਰ

ਸ਼ੁਰੂਆਤੀ ਪੜਾਅ ਦੇ ਸੈਂਪਲ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਉਤਪਾਦਨ, ਪੈਦਾਵਾਰ (yields) ਜਾਂ ਲੰਬੇ ਸਮੇਂ ਦੀ ਭਰੋਸੇਯੋਗਤਾ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਦਿੰਦੇ, ਇਸ ਲਈ ਉਤਸ਼ਾਹ ਨੂੰ ਸੰਜਮ ਵਿੱਚ ਰੱਖਣਾ ਚਾਹੀਦਾ ਹੈ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • ਪ੍ਰੋਡਕਸ਼ਨ ਰੋਲਆਊਟ: ਕੀ OpenAI Jalapeño ਨੂੰ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਤਿਆਰ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਹਿੱਸੇ ਵਿੱਚ ਬਦਲ ਸਕਦਾ ਹੈ, ਅਤੇ ਉਹ ਵੀ ਕਿਸ ਕੀਮਤ 'ਤੇ?
  • ਸੌਫਟਵੇਅਰ ਸਟੈਕ: ਡਿਵੈਲਪਰਾਂ ਲਈ ਪ੍ਰੋਗਰਾਮਿੰਗ ਮਾਡਲ ਅਤੇ ਟੂਲਚੇਨ ਕਿੰਨੀ ਪਰਿਪੱਕ ਹੋਵੇਗੀ?
  • ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦਾ ਪ੍ਰਤੀਕਰਮ: Nvidia ਅਤੇ ਹੋਰ ਵੈਂਡਰਜ਼ ਆਪਣੀ ਮਾਰਕੀਟ ਹਿੱਸੇਦਾਰੀ ਨੂੰ ਬਚਾਉਣ ਲਈ ਆਪਣੇ ਰੋਡਮੈਪ ਜਾਂ ਕੀਮਤਾਂ ਵਿੱਚ ਕੀ ਬਦਲਾਅ ਕਰਨਗੇ?
  • ਮਾਡਲ ਸਕੈਲਿੰਗ: ਕੀ Jalapeño ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲਾਂ ਦੀ ਅਗਲੀ ਲਹਿਰ 'ਤੇ ਆਪਣਾ ਦਬਦਬਾ ਬਣਾਈ ਰੱਖੇਗਾ?

ਸਿੱਟਾ: ਕਸਟਮ ਇਨਫਰੈਂਸ ਸਿਲੀਕਾਨ ਇੱਕ ਸੀਮਤ ਪ੍ਰਯੋਗ ਤੋਂ ਹਟ ਕੇ Nvidia ਦੇ ਹਾਰਡਵੇਅਰ ਦਬਦਬੇ ਲਈ ਇੱਕ ਭਰੋਸੇਯੋਗ ਚੁਣੌਤੀ ਬਣ ਰਿਹਾ ਹੈ।