Cip inferens Jalapeño baharu OpenAI telah mengatasi Blackwell milik Nvidia dalam penanda aras InferenceX, memberikan 1.5 × hingga 1.9 × lebih banyak kerja AI bagi setiap watt dan kependaman (latency) yang jauh lebih rendah. Keputusan ini penting kerana ia boleh mengurangkan kos operasi perkhidmatan model bahasa berskala besar dan memberi tekanan kepada dominasi Nvidia dalam pemecut AI.
Mengapa cip ini penting
OpenAI mendedahkan Jalapeño di persidangan Hot Chips 2026 dan menekankan kerjasama dengan Broadcom bagi pembangunan silikon tersebut. Pereka cip ini menyasarkan ketidakcekapan terbesar dalam saluran paip (pipeline) inferens semasa: pergerakan data semasa peringkat pra-isi (prefill) dan komunikasi antara unit pengkomputeran. Dengan mengekalkan cache kunci-nilai (KV) secara setempat, Jalapeño mengurangkan masa yang dihabiskan untuk menyusun semula tensor, yang seterusnya mempercepatkan penjanaan token dan menjimatkan tenaga.
Angka yang menonjol
- Kerja AI bagi setiap watt: 1.5 × hingga 1.9 × lebih tinggi pada daya pemprosesan puncak berbanding Blackwell.
- Kependaman (Latency): 1.7 × hingga 3.6 × lebih rendah, supaya respons sampai lebih cepat kepada pengguna interaktif.
- Prestasi beban kerja interaktif: 2.1 × hingga 4.1 × lebih tinggi, satu peningkatan yang memberi kesan langsung kepada aplikasi gaya sembang (chat).
Peningkatan ini dapat dilihat dalam penanda aras InferenceX, di mana Jalapeño juga menewaskan cip Rubin milik Nvidia yang akan datang.
Impak perniagaan
OpenAI sudah mula menggunakan peningkatan kecekapan ini untuk mengurangkan harga pada API GPT-5.6 Sol miliknya, dengan menawarkan diskaun sebanyak 20% hingga 33% berbanding kadar sebelumnya. Penggunaan kuasa yang lebih rendah mengurangkan kos menjalankan kluster inferens yang besar, satu penjimatan yang dapat dirasai oleh pembangun dan perusahaan.
Masa dan tekanan persaingan
Jalapeño akan dihantar dalam jumlah terhad menjelang akhir tahun 2026, dengan pengeluaran besar-besaran dijadualkan pada tahun 2027. Menjelang waktu itu, Nvidia menjangkakan generasi GPU yang lebih baharu, yang mungkin dapat merapatkan jurang tersebut. Pelancaran secara berperingkat ini memaksa OpenAI untuk membuktikan manfaat dunia nyata sebelum pesaing melancarkan silikon baharu mereka.
Pandangan berbeza
Nvidia berkemungkinan besar akan mempunyai cip yang lebih baharu di pasaran menjelang waktu itu.
Perkara untuk diperhatikan
- Data penggunaan: Maklum balas awal pelanggan mengenai kependaman dan penjimatan kuasa akan menunjukkan sama ada angka penanda aras tersebut kekal konsisten dalam pengeluaran sebenar.
- Strategi harga: Pemotongan harga API yang berterusan boleh mendorong penyedia lain ke arah perkakasan yang serupa atau berisiko kehilangan syer pasaran.
- Pelan hala tuju Nvidia: Sebarang pengumuman mengenai pemecut baharu yang memfokuskan kepada inferens akan membentuk semula dinamik persaingan.
Pendekatan full-stack OpenAI—membina model, cip, dan memori secara bersama—memberikannya kelebihan yang tidak dimiliki oleh pemecut standard. Sama ada kelebihan tersebut berubah menjadi peralihan pasaran yang berterusan bergantung kepada seberapa cepat cip Jalapeño beralih daripada prototaip kepada penggunaan meluas dan bagaimana Nvidia menjawab cabaran kecekapan tersebut.
