OpenAI ha presentato il proprio chip di inferenza, Jalapeño, affermando che offre fino a 1,9 × il throughput per kilowatt rispetto agli acceleratori GB200 e GB300 di Nvidia. Il team ha trasformato un concetto in un die di silicio funzionante in soli nove mesi, molto più velocemente del consueto ciclo di due o tre anni per i processori AI personalizzati.
Perché questo sprint è importante
OpenAI ora esegue modelli su hardware di Cerebras, AWS Trainium, AMD e altri, invece di fare affidamento esclusivamente sulle GPU di Nvidia. Con il passaggio dei carichi di lavoro dell'IA da un focus sull'addestramento a uno sull'inferenza, il consumo energetico e il costo per query diventano decisivi. Un chip che dimezza l'energia necessaria per un modello da un trilione di parametri potrebbe ridurre drasticamente le spese operative per i servizi che gestiscono miliardi di richieste ogni giorno.
Come l'IA ha scritto il chip
Jalapeño è un ASIC, ovvero un chip costruito per un unico scopo: eseguire modelli linguistici di grandi dimensioni (LLM). A differenza di una GPU general-purpose, un ASIC elimina la logica non necessaria e adatta i percorsi dei dati ai pattern di inferenza degli LLM. Gli ingegneri di OpenAI hanno scritto il design in XLS, un linguaggio di descrizione hardware che consente ai modelli di machine learning di generare codice. L'azienda afferma che la logica generata dall'IA costituisce più della metà del core del chip, riducendo la pipeline di progettazione da anni a mesi.
Dichiarazioni sulle prestazioni vs realtà
OpenAI elenca tre numeri chiave per Jalapeño:
- Throughput per kilowatt: 1,5 – 1,9 × superiore rispetto ai GB200/GB300 di Nvidia.
- Latenza: 1,7 – 3,6 × inferiore rispetto agli stessi modelli Nvidia.
- Consumo energetico su un modello da un trilione di parametri: 700 W contro i 1.400 W del GB300.
Se questi dati si confermeranno, un data center potrebbe eseguire lo stesso modello con la metà del costo elettrico, garantendo al contempo risposte più rapide. Le dichiarazioni si concentrano sull'inferenza; OpenAI non affronta le prestazioni di addestramento, in linea con il suo attuale focus sulla fornitura di applicazioni di tipo chat.
Cosa significa per Nvidia
I prossimi chip Blackwell e Vera Rubin di Nvidia puntano al mercato degli acceleratori di fascia alta. Il vantaggio di Nvidia risiede in uno stack software maturo, in un'ampia adozione da parte degli sviluppatori e nella flessibilità tra i vari compiti di IA. Jalapeño, al contrario, è un dispositivo specializzato che vince solo quando il carico di lavoro corrisponde alla sua specializzazione.
La pressione su Nvidia si sviluppa su due fronti. In primo luogo, i clienti che possono permettersi un ASIC personalizzato potrebbero passare a questa soluzione per i risparmi promessi, erodendo la quota di mercato di Nvidia nell'inferenza. In secondo luogo, la dimostrazione che l'IA può aiutare a progettare l'hardware potrebbe comprimere i cicli di sviluppo dei concorrenti, costringendo Nvidia ad accelerare la propria roadmap.
Controargomentazioni e domande aperte
- Ecosistema software: le librerie CUDA di Nvidia, gli strumenti di profiling e il supporto della community le conferiscono ancora un vantaggio decisivo per la maggior parte degli sviluppatori. L'integrazione di Jalapeño richiederà nuovi toolchain e potenzialmente la riscrittura del codice.
- Validazione nel mondo reale: i numeri derivano dai test interni di OpenAI. Benchmark indipendenti, dati sulla affidabilità a lungo termine e comportamento di scalabilità sotto carichi di lavoro multi-tenant rimangono non verificati.
- Economie di scala: il vantaggio di costo di un ASIC cresce con il volume. L'uso interno di OpenAI potrebbe giustificare l'investimento, ma i clienti esterni potrebbero trovarsi di fronte a prezzi per chip più elevati, a meno che la produzione non aumenti di scala.
Guardando al futuro
Per ora, Jalapeño dimostra che uno sprint di nove mesi può produrre un chip che, sulla carta, supera la GPU dominante nella parte dello stack IA più sensibile ai costi. La vera prova sarà se questo vantaggio sopravviverà alla prova dei carichi di lavoro reali.
