A OpenAI revelou seu próprio chip de inferência, Jalapeño, e afirma que ele entrega até 1,9 × o throughput por quilowatt dos aceleradores GB200 e GB300 da Nvidia. A equipe transformou um conceito em um die de silício funcional em nove meses — muito mais rápido do que o ciclo habitual de dois a três anos para processadores de IA customizados.

Por que essa corrida é importante

A OpenAI agora executa modelos em hardware da Cerebras, AWS Trainium, AMD e outros, em vez de depender exclusivamente de GPUs da Nvidia. À medida que a IA migra de cargas de trabalho focadas em treinamento para cargas focadas em inferência, o consumo de energia e o custo por consulta tornam-se decisivos. Um chip que reduza pela metade a energia necessária para um modelo de um trilhão de parâmetros poderia cortar as despesas operacionais de serviços que lidam com bilhões de solicitações todos os dias.

Como a IA escreveu o chip

O Jalapeño é um ASIC — um chip construído para um único propósito: executar modelos de linguagem de grande escala (LLMs). Ao contrário de uma GPU de propósito geral, um ASIC elimina a lógica desnecessária e adapta os caminhos de dados aos padrões de inferência de LLMs. Os engenheiros da OpenAI escreveram o projeto em XLS, uma linguagem de descrição de hardware que permite que modelos de aprendizado de máquina gerem código. A empresa afirma que a lógica gerada por IA compõe mais da metade do núcleo do chip, reduzindo o pipeline de design de anos para meses.

Promessas de desempenho vs. realidade

A OpenAI lista três números principais para o Jalapeño:

  • Throughput por quilowatt: 1,5 – 1,9 × superior ao dos GB200/GB300 da Nvidia.
  • Latência: 1,7 – 3,6 × menor do que os mesmos modelos da Nvidia.
  • Consumo de energia em um modelo de 1 trilhão de parâmetros: 700 W contra 1.400 W no GB300.

Se esses números se confirmarem, um data center poderá executar o mesmo modelo com metade do custo de eletricidade, ao mesmo tempo em que entrega respostas mais rápidas. As afirmações focam na inferência; a OpenAI não aborda o desempenho de treinamento, alinhando-se com sua ênfase atual em servir aplicações do tipo chat.

O que isso significa para a Nvidia

Os próximos chips Blackwell e Vera Rubin da Nvidia visam o mercado de aceleradores de alto desempenho. A vantagem da Nvidia reside em uma stack de software madura, ampla adoção por desenvolvedores e flexibilidade em diversas tarefas de IA. O Jalapeño, por outro lado, é um dispositivo de propósito restrito que vence apenas quando a carga de trabalho corresponde à sua especialização.

A pressão sobre a Nvidia tem dois ângulos. Primeiro, clientes que podem arcar com um ASIC customizado podem mudar para obter a economia prometida, reduzindo a participação da Nvidia em inferência. Segundo, a demonstração de que a IA pode ajudar a projetar hardware pode comprimir os ciclos de desenvolvimento dos concorrentes, forçando a Nvidia a acelerar seu roadmap.

Contrapontos e questões em aberto

  • Ecossistema de software: As bibliotecas CUDA da Nvidia, ferramentas de profiling e o suporte da comunidade ainda lhe conferem uma vantagem decisiva para a maioria dos desenvolvedores. A integração do Jalapeño exigirá novas toolchains e, possivelmente, reescritas de código.
  • Validação no mundo real: Os números vêm de testes internos da OpenAI. Benchmarks independentes, dados de confiabilidade a longo prazo e o comportamento de escalonamento sob cargas de múltiplos inquilinos (mixed-tenant) permanecem não verificados.
  • Economia de escala: A vantagem de custo de um ASIC cresce com o volume. O uso interno da OpenAI pode justificar o investimento, mas clientes externos podem enfrentar preços por chip mais altos, a menos que a produção ganhe escala.

Olhando para o futuro

Por enquanto, o Jalapeño prova que uma corrida de nove meses pode produzir um chip que, no papel, supera a GPU dominante na parte mais sensível ao custo da stack de IA. O verdadeiro teste será se essa vantagem sobreviverá ao desgaste das cargas de trabalho do mundo real.