OpenAI’s new Jalapeño inference chip outperformed Nvidia’s Blackwell on the InferenceX benchmark, delivering 1.5 × to 1.9 × more AI work per watt and noticeably lower latency. The result matters because it could shrink the operating cost of large-scale language-model services and pressure Nvidia’s dominance in AI accelerators.

Mengapa chip ini penting

OpenAI memperkenalkan Jalapeño di konferensi Hot Chips 2026 dan menyoroti kemitraan dengan Broadcom dalam pembuatan silikonnya. Para perancang menargetkan inefisiensi terbesar dalam alur kerja (pipeline) inferensi saat ini: pergerakan data selama tahap prefill dan komunikasi antar unit komputasi. Dengan menjaga cache key-value (KV) tetap lokal, Jalapeño memangkas waktu yang dihabiskan untuk memindahkan tensor, yang mempercepat pembuatan token dan menghemat energi.

Angka-angka yang menonjol

  • Beban kerja AI per watt: 1,5x hingga 1,9x lebih tinggi pada throughput puncak dibandingkan Blackwell.
  • Latensi: 1,7x hingga 3,6x lebih rendah, sehingga respons tiba lebih cepat bagi pengguna interaktif.
  • Performa beban kerja interaktif: 2,1x hingga 4,1x lebih tinggi, sebuah peningkatan yang berdampak langsung pada aplikasi gaya obrolan (chat).

Peningkatan ini terlihat dalam benchmark InferenceX, di mana Jalapeño juga mengalahkan chip Rubin milik Nvidia yang akan datang.

Dampak bisnis

OpenAI sudah menggunakan peningkatan efisiensi ini untuk memangkas harga pada API GPT-5.6 Sol miliknya, menawarkan diskon sebesar 20% hingga 33% dibandingkan tarif sebelumnya. Konsumsi daya yang lebih rendah menekan biaya menjalankan klaster inferensi masif, sebuah penghematan yang dapat dirasakan oleh pengembang dan perusahaan.

Waktu dan tekanan kompetitif

Jalapeño akan dikirim dalam volume terbatas pada akhir 2026, dengan produksi massal dijadwalkan pada 2027. Pada saat itu, Nvidia diperkirakan akan merilis generasi GPU yang lebih baru, yang dapat memperkecil celah tersebut. Peluncuran yang bertahap ini memaksa OpenAI untuk membuktikan manfaat dunia nyata sebelum kompetitor meluncurkan silikon baru mereka.

Sudut pandang lain

Nvidia kemungkinan besar akan memiliki chip yang lebih baru di pasar pada saat itu.

Hal yang perlu diperhatikan

  • Data penerapan (deployment): Umpan balik awal pelanggan mengenai latensi dan penghematan daya akan menunjukkan apakah angka benchmark tersebut tetap konsisten dalam produksi.
  • Strategi penetapan harga: Pemotongan harga API yang berkelanjutan dapat mendorong penyedia lain menuju perangkat keras serupa atau berisiko kehilangan pangsa pasar.
  • Peta jalan (roadmap) Nvidia: Pengumuman apa pun mengenai akselerator baru yang berfokus pada inferensi akan membentuk kembali dinamika kompetitif.

Pendekatan full-stack OpenAI—membangun model, chip, dan memori secara bersamaan—memberikannya daya ungkit yang tidak dimiliki oleh akselerator standar. Apakah daya ungkit tersebut akan berubah menjadi pergeseran pasar yang langgeng bergantung pada seberapa cepat chip Jalapeño berpindah dari prototipe ke penggunaan luas dan bagaimana Nvidia menjawab tantangan efisiensi tersebut.