Семейство GPU NVIDIA Blackwell содержит 208 миллиардов транзисторов и способно обеспечить пропускную способность до 130 ТБ/с в домене из 72 графических процессоров. Это решение нацелено на языковые модели с триллионами параметров, которые доминируют в гонке генеративного ИИ, и заставляет операторов дата-центров пересматривать подходы к питанию, охлаждению и выбору шасси, прежде чем они смогут воспользоваться преимуществами в скорости.

Аппаратный скачок

Blackwell использует специализированный техпроцесс TSMC 4NP, который жертвует чистой тактовой частотой ради лучшей энергоэффективности. Каждый GPU состоит из двух кристаллов, соединенных внутренним каналом со скоростью 10 ТБ/с, что позволяет паре работать как единый логический процессор. Архитектура включает Transformer Engine второго поколения, NVLink и NVLink Switch пятого поколения, а также блоки, ориентированные на безопасность, называемые confidential computing, движок декомпрессии (Decompression Engine) и RAS (надежность, доступность, обслуживаемость).

Самое заметное изменение касается обработки точности. H100 от Hopper полагался на FP8 для смешанных вычислений ИИ; Blackwell переходит на микротензорное масштабирование FP4. Новая версия NVLink также поднимает потолок для связи между GPU, поддерживая до 576 процессоров в единой фабрике и обеспечивая пропускную способность в 130 ТБ/с, заявленную NVIDIA.

Hopper против Blackwell на практике

Характеристика Hopper (H100) Blackwell (B200)
Основная направленность Смешанные нагрузки AI и HPC Большие языковые модели
Точность FP8 FP4 micro-tensor
Интерконнект NVLink 4-го поколения NVLink 5-го поколения (до 576 GPU)
Пропускная способность домена 130 ТБ/с (72-GPU)
Безопасность Стандартный ввод-вывод GPU Первый GPU с TEE-I/O (доверенная среда исполнения)

Таблица показывает, что Blackwell ориентирован на большие языковые модели.

Проблемы инфраструктуры

Один GPU Blackwell под нагрузкой может потреблять до 1 кВт, что раздвигает границы возможностей типичных систем распределения питания в дата-центрах. Воздушное охлаждение, подходящее для большинства серверных чипов, не способно достаточно быстро отводить такое тепло; контуры жидкостного охлаждения становятся обязательным условием. Форм-фактор также не позволяет использовать устаревшие шасси. Собственные платформы NVIDIA, такие как HGX и DGX, являются примерами систем, способных разместить эти чипы.

Кто выиграет

  • Разработчики LLM получают возможность более быстрого обучения и тонкой настройки.
  • Кластеры инференса, обслуживающие чат-приложения, демонстрируют более низкую задержку и более высокую пропускную способность благодаря масштабированию FP4 и огромной пропускной способности между GPU.
  • Конвейеры аналитики больших данных, полагающиеся на аугментацию или суммаризацию на базе трансформеров, могут выполнять больше задач параллельно.
  • Команды робототехники, обучающие модели компьютерного зрения в больших масштабах, получают более быстрые циклы итераций, что является преимуществом при ограниченных окнах для тестирования в реальных условиях.

Обратная сторона медали

Те самые сильные стороны, которые делают Blackwell привлекательным, также ограничивают его немедленный рынок.

На что обратить внимание

  • Кривые внедрения
  • Готовность программного стека
  • Модернизация электросетей

Итог

Blackwell выводит аппаратное обеспечение для ИИ на новый уровень чистой производительности, но это также требует параллельной модернизации всей окружающей экосистемы.