Die Blackwell-GPU-Familie von NVIDIA verfügt über 208 Milliarden Transistoren und kann in einem 72-GPU-Verbund eine Bandbreite von bis zu 130 TB/s liefern. Dieser Schritt zielt auf Billionen-Parameter-Sprachmodelle ab, die den Wettlauf um generative KI dominieren, und zwingt Rechenzentrumbetreiber dazu, Stromversorgung, Kühlung und Gehäusewahl zu überdenken, bevor sie von den Geschwindigkeitsgewinnen profitieren können.
Der Hardware-Sprung
Blackwell nutzt einen maßgeschneiderten TSMC 4NP-Prozess, der die reine Taktrate zugunsten einer besseren Energieeffizienz opfert. Jede GPU besteht aus zwei Dies, die durch eine interne Verbindung mit 10 TB/s miteinander verknüpft sind, sodass das Paar als ein einziger logischer Prozessor agieren kann. Die Architektur ergänzt eine Transformer Engine der zweiten Generation, NVLink und einen NVLink Switch der fünften Generation sowie sicherheitsorientierte Blöcke wie Confidential Computing, eine Decompression Engine und RAS (Reliability, Availability, Serviceability).
Die sichtbarste Änderung ist der Umgang mit der Präzision. Die H100 von Hopper verließ sich bei Mixed-Precision-KI-Aufgaben auf FP8; Blackwell setzt auf FP4-Micro-Tensor-Skalierung. Die neue NVLink-Version hebt zudem die Obergrenze für die GPU-zu-GPU-Kommunikation an, unterstützt bis zu 576 GPUs in einem einzigen Fabric und liefert die von NVIDIA angegebene Bandbreite von 130 TB/s.
Hopper vs. Blackwell in der Praxis
| Merkmal | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| Hauptfokus | Mixed AI- und HPC-Workloads | Große Sprachmodelle |
| Präzision | FP8 | FP4-Micro-Tensor |
| Interconnect | NVLink der 4. Generation | NVLink der 5. Generation (bis zu 576 GPUs) |
| Verbund-Bandbreite | – | 130 TB/s (72-GPU) |
| Sicherheit | Standard-GPU-I/O | Erste GPU mit TEE-I/O (Trusted Execution Environment) |
Die Tabelle zeigt, dass Blackwell auf große Sprachmodelle fokussiert ist.
Infrastruktur-Probleme
Eine einzelne Blackwell-GPU kann unter Last bis zu 1 kW Strom ziehen, was die Grenzen der typischen Stromverteilung in Rechenzentren ausreizt. Luftkühlung, die für die meisten Silizium-Komponenten auf Server-Niveau funktioniert, kann diese Hitze nicht schnell genug abführen; Flüssigkeitskühlkreisläufe werden zur Voraussetzung. Auch der Formfaktor passt nicht in herkömmliche Gehäuse. NVIDIAs eigene HGX- und DGX-Plattformen sind Beispiele für Systeme, die diese Chips aufnehmen können.
Wer profitiert
- LLM-Entwickler profitieren von schnellerem Training und Fine-Tuning.
- Inferenz-Cluster, die Chat-Anwendungen bedienen, profitieren dank FP4-Skalierung und massiver Inter-GPU-Bandbreite von geringerer Latenz und höherem Durchsatz.
- Big-Data-Analytics-Pipelines, die auf Transformer-basierter Augmentierung oder Zusammenfassung beruhen, können mehr Jobs parallel ausführen.
- Robotik-Teams, die Vision-Modelle in großem Maßstab trainieren, profitieren von schnelleren Iterationszyklen – ein Vorteil, wenn die Zeitfenster für Tests unter realen Bedingungen eng sind.
Die Kehrseite der Medaille
Genau die Stärken, die Blackwell attraktiv machen, schränken auch dessen unmittelbaren Markt ein.
Worauf man achten sollte
- Adoptionskurven
- Reifegrad des Software-Stacks
- Upgrades des Stromnetzes
Fazit
Blackwell hebt KI-Hardware in eine neue Dimension der Rohleistung, erzwingt aber gleichzeitig ein paralleles Upgrade des umliegenden Ökosystems.
