La nouvelle puce d'inférence Jalapeño d'OpenAI a surpassé la Blackwell de Nvidia sur le benchmark InferenceX, délivrant 1,5 à 1,9 fois plus de travail d'IA par watt et une latence nettement inférieure. Ce résultat est crucial car il pourrait réduire les coûts d'exploitation des services de modèles de langage à grande échelle et mettre sous pression la domination de Nvidia dans le domaine des accélérateurs d'IA.

Pourquoi cette puce est importante

OpenAI a dévoilé Jalapeño lors de la conférence Hot Chips 2026 et a mis en avant un partenariat avec Broadcom pour la conception du silicium. Les concepteurs ont ciblé les plus grandes inefficacités des pipelines d'inférence actuels : le mouvement des données pendant l'étape de pré-remplissage (prefill) et la communication entre les unités de calcul. En conservant le cache clé-valeur (KV) localement, Jalapeño réduit le temps passé à déplacer les tenseurs, ce qui accélère la génération de tokens et économise de l'énergie.

Des chiffres marquants

  • Travail d'IA par watt : 1,5 à 1,9 fois plus élevé en débit de pointe que Blackwell.
  • Latence : 1,7 à 3,6 fois plus faible, permettant ainsi des réponses plus rapides pour les utilisateurs interactifs.
  • Performance des charges de travail interactives : 2,1 à 4,1 fois supérieure, un gain qui impacte directement les applications de type chat.

Ces gains apparaissent dans le benchmark InferenceX, où Jalapeño a également battu les futures puces Rubin de Nvidia.

Impact commercial

OpenAI utilise déjà ces gains d'efficacité pour réduire les prix de son API GPT-5.6 Sol, offrant des remises de 20 % à 33 % par rapport aux tarifs précédents. Une consommation d'énergie réduite diminue le coût d'exploitation des clusters d'inférence massifs, une économie dont les développeurs et les entreprises pourront bénéficier directement.

Calendrier et pression concurrentielle

Jalapeño sera expédiée en volumes limités d'ici la fin de 2026, la production de masse étant prévue pour 2027. D'ici là, Nvidia prévoit de nouvelles générations de GPU, ce qui pourrait réduire l'écart. Ce déploiement échelonné oblige OpenAI à prouver les bénéfices en conditions réelles avant que ses concurrents ne lancent de nouveaux composants.

Contrepoint

Nvidia aura probablement de nouvelles puces sur le marché d'ici là.

À surveiller

  • Données de déploiement : Les premiers retours clients sur la latence et les économies d'énergie montreront si les chiffres du benchmark se maintiennent en production.
  • Stratégie de prix : La poursuite des baisses de prix de l'API pourrait pousser d'autres fournisseurs vers du matériel similaire ou les faire risquer de perdre des parts de marché.
  • Feuille de route de Nvidia : Toute annonce d'un nouvel accélérateur axé sur l'inférence redéfinira la dynamique concurrentielle.

L'approche full-stack d'OpenAI — concevoir conjointement des modèles, des puces et de la mémoire — lui donne un levier dont les accélérateurs standards sont dépourvus. La question de savoir si ce levier se transformera en un changement de marché durable dépendra de la rapidité avec laquelle la puce Jalapeño passera du prototype à une utilisation généralisée et de la manière dont Nvidia répondra au défi de l'efficacité.