OpenAI presentó su propio chip de inferencia, Jalapeño, y afirma que ofrece hasta 1,9× el rendimiento por kilovatio de los aceleradores GB200 y GB300 de Nvidia. El equipo convirtió un concepto en una matriz de silicio funcional en nueve meses, mucho más rápido que el ciclo habitual de dos a tres años para los procesadores de IA personalizados.

Por qué es importante esta carrera

OpenAI ahora ejecuta modelos en hardware de Cerebras, AWS Trainium, AMD y otros, en lugar de depender únicamente de las GPU de Nvidia. A medida que la IA pasa de cargas de trabajo centradas en el entrenamiento a cargas centradas en la inferencia, el consumo de energía y el coste por consulta se vuelven decisivos. Un chip que reduzca a la mitad la energía necesaria para un modelo de un billón de parámetros podría recortar los gastos operativos de los servicios que gestionan miles de millones de solicitudes cada día.

Cómo la IA escribió el chip

Jalapeño es un ASIC, un chip diseñado para un único propósito: ejecutar modelos de lenguaje extensos (LLM). A diferencia de una GPU de propósito general, un ASIC elimina la lógica innecesaria y adapta las rutas de datos a los patrones de inferencia de los LLM. Los ingenieros de OpenAI escribieron el diseño en XLS, un lenguaje de descripción de hardware que permite que los modelos de aprendizaje automático generen código. La empresa afirma que la lógica generada por IA constituye más de la mitad del núcleo del chip, reduciendo el flujo de diseño de años a meses.

Promesas de rendimiento frente a la realidad

OpenAI enumera tres cifras principales para Jalapeño:

  • Rendimiento por kilovatio: 1,5 – 1,9× superior al de los GB200/GB300 de Nvidia.
  • Latencia: 1,7 – 3,6× inferior a los mismos modelos de Nvidia.
  • Consumo de energía en un modelo de un billón de parámetros: 700 W frente a 1.400 W en el GB300.

Si estas cifras se mantienen, un centro de datos podría ejecutar el mismo modelo con la mitad del coste eléctrico y, al mismo tiempo, ofrecer respuestas más rápidas. Las afirmaciones se centran en la inferencia; OpenAI no aborda el rendimiento del entrenamiento, lo que se alinea con su énfasis actual en ofrecer aplicaciones de tipo chat.

Qué significa esto para Nvidia

Los próximos chips Blackwell y Vera Rubin de Nvidia se dirigen al mercado de aceleradores de gama alta. La ventaja de Nvidia reside en un stack de software maduro, una amplia adopción por parte de los desarrolladores y la flexibilidad en diversas tareas de IA. Jalapeño, por el contrario, es un dispositivo de propósito específico que solo gana cuando la carga de trabajo coincide con su especialización.

La presión sobre Nvidia tiene dos vertientes. Primero, los clientes que pueden permitirse un ASIC personalizado podrían cambiarse para obtener los ahorros prometidos, mermando la cuota de inferencia de Nvidia. Segundo, la demostración de que la IA puede ayudar a diseñar hardware podría comprimir los ciclos de desarrollo de la competencia, obligando a Nvidia a acelerar su hoja de ruta.

Contrapuntos y preguntas abiertas

  • Ecosistema de software: Las librerías CUDA de Nvidia, sus herramientas de perfilado y el apoyo de la comunidad todavía le otorgan una ventaja decisiva para la mayoría de los desarrolladores. La integración de Jalapeño requerirá nuevas cadenas de herramientas y, posiblemente, la reescritura de código.
  • Validación en el mundo real: Las cifras provienen de las pruebas internas de OpenAI. Los benchmarks independientes, los datos de fiabilidad a largo plazo y el comportamiento de escalado bajo cargas de trabajo de múltiples inquilinos siguen sin verificarse.
  • Economías de escala: La ventaja de costes de un ASIC crece con el volumen. El uso interno de OpenAI puede justificar la inversión, pero los clientes externos podrían enfrentarse a precios por chip más altos a menos que la producción se escale.

Mirando hacia el futuro

Por ahora, Jalapeño demuestra que una carrera de nueve meses puede producir un chip que, sobre el papel, supera a la GPU dominante en la parte de la pila de IA más sensible al coste. La verdadera prueba será si esa ventaja sobrevive al desgaste de las cargas de trabajo del mundo real.