Benchmark-Highlights
Auf der Hot Chips Konferenz wurden Zahlen vorgestellt, die von einer unabhängigen Firma mit der InferenceX-Suite verifiziert wurden. OpenAI bezeichnet Jalapeño als einen universell einsetzbaren Inference-Beschleuniger – er führt Modelle aus, trainiert sie jedoch nicht. In den Tests lieferte der Chip:
- 1,5- bis 1,9-mal mehr Arbeit pro Watt bei maximalem Durchsatz als die heutigen Marktführer.
- Reduzierte die Latenz um das 1,7- bis 3,6-fache, mit interaktiven Gewinnen von 2,1- bis 4,1-mal.
Modellspezifische Ergebnisse:
- GPT-OSS 120B: ~1.400 Tokens/Sekunde/Nutzer.
- Deepseek R1 670B: ~700 Tokens/Sekunde bei einer einzelnen gleichzeitigen Anfrage.
- Kimi K2.5 1T: getestet in der High-Performance-Suite (genaue Zahlen wurden nicht veröffentlicht).
OpenAI betonte, dass diese Zahlen ohne speculative decoding oder multi-token prediction erzielt wurden – Tricks, die viele Konkurrenten nutzen, um ihre Schlagzeilen-Zahlen aufzublähen.
Wie Jalapeño entwickelt wurde
OpenAI schloss das Design des Chips in neun Monaten in Zusammenarbeit mit Broadcom ab. Das Unternehmen speiste seine eigenen Modelle in den Design-Zyklus ein, was das Blueprinting, die Programmierung und die Optimierung beschleunigte – eine Methode, die als „AI-assisted silicon design“ bezeichnet wird. Dieser Sprint verdeutlicht den Wandel weg von den mehrjährigen Zyklen, die Hochleistungs-Silizium einst prägten.
Auswirkungen auf Nvidias Führungsposition
Nvidia setzt auf reine Rechenleistung und das CUDA-Ökosystem. Die neuen Daten machen den Leistungsvorsprung angreifbar. Analysten warnen davor, dass sich Entwickler von CUDA abwenden könnten, falls mehr KI-Unternehmen maßgeschneiderte Inference-Chips mit ähnlicher Effizienz auf den Markt bringen, was Raum für alternative Stacks und einen fragmentierten Markt schaffen würde.
OpenAIs Mixed-Signal-Strategie
Finanzvorstand (CFO) Kelly Huang stellte Jalapeño als einen Teil eines umfassenderen Compute-Plans dar, nicht als vollständigen Ersatz für bestehende Partner. OpenAI arbeitet bei verschiedenen Workloads weiterhin mit Nvidia, AMD, AWS und Cerebras zusammen. Jalapeño ist noch ein Engineering-Sample; es muss sich erst noch den größten kommenden Modellen wie Deepseek V4 Pro stellen. Huangs Kommentare deuten darauf hin, dass OpenAI sein eigenes Silizium mit Beschleunigern von Drittanbietern mischen wird, um das beste Preis-Leistungs-Verhältnis für jede Aufgabe zu erzielen.
Gegenargumente
Prototypen in einem frühen Stadium garantieren keine Massenproduktion, Ausbeute (Yields) oder langfristige Zuverlässigkeit, weshalb die Euphorie gedämpft werden sollte.
Worauf man als Nächstes achten sollte
- Produktionsstart: Kann OpenAI Jalapeño in ein Massenprodukt verwandeln, und zu welchem Preis?
- Software-Stack: Wie ausgereift werden das Programmiermodell und die Toolchain für Entwickler sein?
- Reaktion der Wettbewerber: Wie werden Nvidia und andere Anbieter ihre Roadmaps oder Preise anpassen, um Marktanteile zu schützen?
- Modell-Skalierung: Wird Jalapeño seinen Vorsprung bei der nächsten Welle von Billionen-Parameter-Modellen behalten?
Fazit: Maßgeschneiderte Inference-Chips entwickeln sich von einem Nischenexperiment zu einer ernstzunehmenden Herausforderung für Nvidias Hardware-Dominanz.
