NVIDIA의 Blackwell GPU 제품군은 2,080억 개의 트랜지스터를 탑재하고 있으며, 72개의 GPU 도메인에서 최대 130TB/s의 대역폭을 제공할 수 있습니다. 이러한 변화는 생성형 AI 경쟁을 주도하는 조 단위 파라미터(trillion-parameter) 언어 모델을 겨냥하고 있으며, 데이터 센터 운영자들이 속도 향상의 이점을 누리기 전에 전력, 냉각 및 섀시 선택을 재고하도록 만듭니다.
하드웨어의 도약
Blackwell은 에너지 효율을 높이기 위해 원시 클록 속도를 희생한 커스텀 TSMC 4NP 프로세스를 사용합니다. 각 GPU는 10TB/s 내부 링크로 연결된 두 개의 다이(die)로 구성되어, 한 쌍이 하나의 논리적 프로세서처럼 작동할 수 있게 합니다. 이 아키텍처에는 2세대 Transformer Engine, 5세대 NVLink 및 NVLink Switch가 추가되었으며, confidential computing이라 불리는 보안 중심 블록, Decompression Engine 및 RAS(Reliability, Availability, Serviceability)가 포함됩니다.
가장 눈에 띄는 변화는 정밀도 처리 방식입니다. Hopper의 H100은 혼합 정밀도 AI 작업을 위해 FP8에 의존했지만, Blackwell은 FP4 마이크로 텐서(micro-tensor) 스케일링으로 내려갑니다. 새로운 NVLink 버전은 GPU 간 통신 한계치도 높여, 단일 패브릭에서 최대 576개의 GPU를 지원하며 NVIDIA가 언급한 130TB/s의 수치를 구현합니다.
실전에서의 Hopper vs. Blackwell
| 기능 | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| 주요 초점 | 혼합 AI 및 HPC 워크로드 | 대규모 언어 모델 |
| 정밀도 | FP8 | FP4 마이크로 텐서 |
| 상호 연결 | 4세대 NVLink | 5세대 NVLink (최대 576개 GPU) |
| 도메인 대역폭 | – | 130TB/s (72-GPU) |
| 보안 | 표준 GPU I/O | TEE-I/O(신뢰 실행 환경)를 갖춘 최초의 GPU |
이 표는 Blackwell이 대규모 언어 모델에 집중하고 있음을 보여줍니다.
인프라의 난제
단일 Blackwell GPU는 부하 시 최대 1kW의 전력을 소모할 수 있어, 일반적인 데이터 센터 전력 분배의 한계를 밀어붙입니다. 대부분의 서버급 실리콘에 적합한 공랭식으로는 그 열을 충분히 빠르게 방출할 수 없으므로, 액체 냉각 루프가 필수 조건이 됩니다. 폼 팩터 또한 기존의 레거시 섀시에 맞지 않습니다. NVIDIA의 HGX 및 DGX 플랫폼이 이러한 칩을 수용할 수 있는 시스템의 예입니다.
수혜 대상
- LLM 개발자는 더 빠른 학습 및 미세 조정(fine-tuning)이 가능해집니다.
- 추론 클러스터는 FP4 스케일링과 방대한 GPU 간 대역폭 덕분에 채팅형 애플리케이션 서비스 시 더 낮은 지연 시간과 더 높은 처리량을 제공합니다.
- 빅데이터 분석 파이프라인은 트랜스포머 기반의 증강 또는 요약에 의존하는 경우 더 많은 작업을 병렬로 실행할 수 있습니다.
- 로보틱스 팀은 대규모 비전 모델을 학습할 때 더 빠른 반복 주기(iteration cycles)를 누릴 수 있으며, 이는 실제 테스트 기간이 짧을 때 큰 장점이 됩니다.
동전의 양면
Blackwell을 매력적으로 만드는 바로 그 강점들이 즉각적인 시장 확대를 제한하기도 합니다.
주목해야 할 점
- 도입 곡선(Adoption curves)
- 소프트웨어 스택 준비성
- 전력망 업그레이드
요약
Blackwell은 AI 하드웨어를 새로운 차원의 원시 성능 단계로 끌어올리지만, 동시에 주변 생태계의 병행 업그레이드를 강요합니다.
