NVIDIA 的 Blackwell GPU 系列拥有 2080 亿个晶体管,在 72 个 GPU 组成的域(domain)中可提供高达 130 TB/s 的带宽。此举旨在应对主导生成式 AI 竞赛的万亿参数语言模型,并迫使数据中心运营商在获得速度提升之前,重新思考功耗、冷却和机箱的选择。
硬件飞跃
Blackwell 采用定制的 TSMC 4NP 工艺,通过牺牲原始时钟频率来换取更高的能效。每个 GPU 由两个通过 10 TB/s 内部链路连接在一起的晶粒(dies)组成,使这对晶粒能够作为一个单一的逻辑处理器运行。该架构增加了第二代 Transformer Engine、第五代 NVLink 和 NVLink Switch,以及名为机密计算(confidential computing)的安全模块、解压缩引擎(Decompression Engine)和 RAS(可靠性、可用性、可维护性)。
最显著的变化在于精度处理。Hopper 架构的 H100 在混合精度 AI 工作中依赖 FP8;而 Blackwell 则降至 FP4 微张量(micro-tensor)缩放。新版本的 NVLink 还提高了 GPU 间通信的上限,在单个网络(fabric)中支持多达 576 个 GPU,并实现了 NVIDIA 所引用的 130 TB/s 带宽。
Hopper 与 Blackwell 的实际对比
| 特性 | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| 主要侧重 | 混合 AI 和 HPC 工作负载 | 大语言模型 |
| 精度 | FP8 | FP4 微张量 |
| 互连 | 第 4 代 NVLink | 第 5 代 NVLink (支持多达 576 个 GPU) |
| 域带宽 | – | 130 TB/s (72 个 GPU) |
| 安全性 | 标准 GPU I/O | 首款具备 TEE-I/O (可信执行环境) 的 GPU |
表格显示 Blackwell 专注于大语言模型。
基础设施难题
单个 Blackwell GPU 在负载下功耗可达 1 kW,挑战了典型数据中心配电的极限。适用于大多数服务器级芯片的风冷技术无法足够快地散发这种热量;液冷循环成为了必要前提。其外形尺寸也无法适配传统的机箱。NVIDIA 自有的 HGX 和 DGX 平台是能够容纳这些芯片的系统示例。
谁将受益
- LLM 开发人员将获得更快的训练和微调速度。
- 推理集群(用于聊天类应用)得益于 FP4 缩放和巨大的 GPU 间带宽,将实现更低的延迟和更高的吞吐量。
- 大数据分析流水线(依赖基于 Transformer 的增强或摘要技术)可以并行运行更多任务。
- 机器人团队在进行大规模视觉模型训练时,可以享受更快的迭代周期,这在现实世界测试窗口较窄时是一项优势。
硬币的另一面
正是那些让 Blackwell 极具吸引力的优势,也限制了其眼下的市场规模。
值得关注的方面
- 采用曲线
- 软件栈就绪程度
- 电网升级
总结
Blackwell 将 AI 硬件推向了原始性能的新高度,但同时也迫使周边生态系统进行同步升级。
