Сімейство GPU NVIDIA Blackwell містить 208 мільярдів транзисторів і може забезпечувати пропускну здатність до 130 ТБ/с у домені з 72 GPU. Цей крок спрямований на трильйонні мовні моделі, які домінують у гонці генеративного ШІ, і змушує операторів дата-центрів переосмислити вибір живлення, охолодження та шасі, перш ніж вони зможуть отримати переваги у швидкості.
Апаратний стрибок
Blackwell використовує спеціалізований техпроцес TSMC 4NP, який жертвує чистою тактовою частотою заради кращої енергоефективності. Кожен GPU складається з двох кристалів, з'єднаних між собою внутрішнім каналом зв'язку швидкістю 10 ТБ/с, що дозволяє парі працювати як єдиний логічний процесор. Архітектура додає Transformer Engine другого покоління, NVLink та NVLink Switch п'ятого покоління, а також блоки, орієнтовані на безпеку, такі як confidential computing, Decompression Engine та RAS (Reliability, Availability, Serviceability).
Найбільш помітною зміною є обробка точності. H100 від Hopper покладався на FP8 для роботи ШІ зі змішаною точністю; Blackwell переходить до масштабування мікротензорів FP4. Нова версія NVLink також піднімає планку для зв'язку між GPU, підтримуючи до 576 GPU в єдиній фабриці та забезпечуючи показник 130 ТБ/с, наведений NVIDIA.
Hopper проти Blackwell на практиці
| Характеристика | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| Основне спрямування | Змішані навантаження ШІ та HPC | Великі мовні моделі |
| Точність | FP8 | FP4 micro-tensor |
| Інтерконект | 4-те покоління NVLink | 5-те покоління NVLink (до 576 GPU) |
| Пропускна здатність домену | – | 130 ТБ/с (72 GPU) |
| Безпека | Стандартне введення/виведення GPU | Перший GPU з TEE-I/O (довірене середовище виконання) |
Таблиця показує, що Blackwell зосереджений на великих мовних моделях.
Проблеми з інфраструктурою
Один GPU Blackwell під навантаженням може споживати до 1 кВт, що наближається до меж типового розподілу електроенергії в дата-центрах. Повітряне охолодження, яке підходить для більшості серверних чипів, не може відводити таке тепло достатньо швидко; контури рідинного охолодження стають необхідною умовою. Форм-фактор також не дозволяє вписати чипи в застарілі шасі. Власними прикладами систем, що можуть вмістити ці чипи, є платформи HGX та DGX від NVIDIA.
Хто отримає вигоду
- Розробники LLM отримують швидше навчання та донавчання (fine-tuning).
- Кластери інференсу, що обслуговують чат-додатки, спостерігатимуть за нижчою затримкою та вищою пропускною здатністю завдяки масштабуванню FP4 та величезній пропускній здатності між GPU.
- Конвеєри аналітики великих даних, які покладаються на аугментацію або сумаризацію на основі трансформерів, зможуть виконувати більше завдань паралельно.
- Команди з робототехніки, які навчають моделі комп'ютерного зору у великих масштабах, отримають швидші цикли ітерацій, що є важливою перевагою, коли вікна для тестування в реальних умовах обмежені.
Інша сторона медалі
Самі переваги, які роблять Blackwell привабливим, також обмежують його негайний ринок.
На що варто звернути увагу
- Криві впровадження
- Готовність програмного стека
- Модернізація електромереж
Підсумок
Blackwell виводить апаратне забезпечення для ШІ на новий рівень продуктивності, але водночас змушує проводити паралельну модернізацію навколишньої екосистеми.
