Семейство GPU NVIDIA Blackwell содержит 208 миллиардов транзисторов и способно обеспечить пропускную способность до 130 ТБ/с в домене из 72 графических процессоров. Это решение нацелено на языковые модели с триллионами параметров, которые доминируют в гонке генеративного ИИ, и заставляет операторов дата-центров пересматривать подходы к питанию, охлаждению и выбору шасси, прежде чем они смогут воспользоваться преимуществами в скорости.
Аппаратный скачок
Blackwell использует специализированный техпроцесс TSMC 4NP, который жертвует чистой тактовой частотой ради лучшей энергоэффективности. Каждый GPU состоит из двух кристаллов, соединенных внутренним каналом со скоростью 10 ТБ/с, что позволяет паре работать как единый логический процессор. Архитектура включает Transformer Engine второго поколения, NVLink и NVLink Switch пятого поколения, а также блоки, ориентированные на безопасность, называемые confidential computing, движок декомпрессии (Decompression Engine) и RAS (надежность, доступность, обслуживаемость).
Самое заметное изменение касается обработки точности. H100 от Hopper полагался на FP8 для смешанных вычислений ИИ; Blackwell переходит на микротензорное масштабирование FP4. Новая версия NVLink также поднимает потолок для связи между GPU, поддерживая до 576 процессоров в единой фабрике и обеспечивая пропускную способность в 130 ТБ/с, заявленную NVIDIA.
Hopper против Blackwell на практике
| Характеристика | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| Основная направленность | Смешанные нагрузки AI и HPC | Большие языковые модели |
| Точность | FP8 | FP4 micro-tensor |
| Интерконнект | NVLink 4-го поколения | NVLink 5-го поколения (до 576 GPU) |
| Пропускная способность домена | – | 130 ТБ/с (72-GPU) |
| Безопасность | Стандартный ввод-вывод GPU | Первый GPU с TEE-I/O (доверенная среда исполнения) |
Таблица показывает, что Blackwell ориентирован на большие языковые модели.
Проблемы инфраструктуры
Один GPU Blackwell под нагрузкой может потреблять до 1 кВт, что раздвигает границы возможностей типичных систем распределения питания в дата-центрах. Воздушное охлаждение, подходящее для большинства серверных чипов, не способно достаточно быстро отводить такое тепло; контуры жидкостного охлаждения становятся обязательным условием. Форм-фактор также не позволяет использовать устаревшие шасси. Собственные платформы NVIDIA, такие как HGX и DGX, являются примерами систем, способных разместить эти чипы.
Кто выиграет
- Разработчики LLM получают возможность более быстрого обучения и тонкой настройки.
- Кластеры инференса, обслуживающие чат-приложения, демонстрируют более низкую задержку и более высокую пропускную способность благодаря масштабированию FP4 и огромной пропускной способности между GPU.
- Конвейеры аналитики больших данных, полагающиеся на аугментацию или суммаризацию на базе трансформеров, могут выполнять больше задач параллельно.
- Команды робототехники, обучающие модели компьютерного зрения в больших масштабах, получают более быстрые циклы итераций, что является преимуществом при ограниченных окнах для тестирования в реальных условиях.
Обратная сторона медали
Те самые сильные стороны, которые делают Blackwell привлекательным, также ограничивают его немедленный рынок.
На что обратить внимание
- Кривые внедрения
- Готовность программного стека
- Модернизация электросетей
Итог
Blackwell выводит аппаратное обеспечение для ИИ на новый уровень чистой производительности, но это также требует параллельной модернизации всей окружающей экосистемы.
