Familia ya GPU za Blackwell za NVIDIA ina tranzista bilioni 208 na inaweza kutoa upana wa mawasiliano (bandwidth) wa hadi 130 TB/s katika eneo la GPU 72. Hatua hii inalenga mifano ya lugha yenye vigezo trilioni (trillion-parameter language models) inayotawala mbio za AI ya kuzalisha (generative-AI) na inawalazimu waendeshaji wa vituo vya data (data-center) kufikiria upya chaguzi za nguvu, ubaridi, na mifupa ya mashine (chassis) kabla ya kuweza kufaidika na ongezeko la kasi.
Hatua kubwa ya vifaa (hardware)
Blackwell inatumia mchakato maalum wa TSMC 4NP ambao unajitoa kwa kasi ya saa (clock speed) ili kupata ufanisi bora wa nishati. Kila GPU inajumuisha dies mbili zilizounganishwa kwa kiunganishi cha ndani cha 10 TB/s, ikiruhusu jozi hiyo kufanya kazi kama kichakataji kimoja cha kimantiki (single logical processor). Muundo huu (architecture) unaongeza Transformer Engine ya kizazi cha pili, NVLink na NVLink Switch ya kizazi cha tano, pamoja na vizuizi vinavyozingatia usalama vinavyoitwa confidential computing, Decompression Engine, na RAS (Reliability, Availability, Serviceability).
Mabadiliko yanayoonekana zaidi ni usimamizi wa usahihi (precision handling). H100 ya Hopper ilitegemea FP8 kwa kazi za AI za usahihi mchanganyiko (mixed-precision); Blackwell inashuka hadi FP4 micro-tensor scaling. Toleo jipya la NVLink pia linaongeza uwezo wa mawasiliano kati ya GPU na GPU, likisaidia hadi GPU 576 katika muundo mmoja (single fabric) na kutoa takwimu ya 130 TB/s iliyotajwa na NVIDIA.
Hopper dhidi ya Blackwell katika vitendo
| Kipengele | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| Lengo kuu | Kazi mchanganyiko za AI na HPC | Mifano mikubwa ya lugha (Large language models) |
| Usahihi (Precision) | FP8 | FP4 micro-tensor |
| Kiunganishi (Interconnect) | 4th-gen NVLink | 5th-gen NVLink (hadi GPU 576) |
| Upana wa mawasiliano (Domain bandwidth) | – | 130 TB/s (GPU 72) |
| Usalama | Standard GPU I/O | GPU ya kwanza yenye TEE-I/O (trusted execution environment) |
Jedwali linaonyesha kuwa Blackwell inalenga mifano mikubwa ya lugha.
Changamoto za miundombinu
GPU moja ya Blackwell inaweza kutumia hadi 1 kW wakati inafanya kazi, jambo linalovuka mipaka ya usambazaji wa nguvu wa kawaida wa vituo vya data. Ubaridi wa hewa (air cooling), ambao hufanya kazi kwa silikoni nyingi za daraja la seva, hauwezi kuondoa joto hilo kwa haraka ya kutosha; mifumo ya ubaridi wa maji (liquid-cooling loops) inakuwa hitaji la lazima. Muundo wake (form factor) pia hautoshi kwenye mifupa ya zamani (legacy chassis). Mifumo ya HGX na DGX ya NVIDIA yenyewe ni mifano ya mifumo inayoweza kuchukua chip hizi.
Nani anafaidika
- Waendelezaji wa LLM wanapata mafunzo (training) na marekebisho (fine-tuning) ya haraka zaidi.
- Makundi ya inference (Inference clusters) yanayohudumia programu za aina ya chat yana ucheleweshaji (latency) mdogo na uwezo mkubwa wa usindikaji (throughput) kutokana na FP4 scaling na upana mkubwa wa mawasiliano kati ya GPU.
- Mifumo ya uchambuzi wa data kubwa (Big-data analytics pipelines) inayotegemea uongezaji (augmentation) au muhtasari (summarization) unaozingatia transformer inaweza kuendesha kazi nyingi kwa wakati mmoja (in parallel).
- Timu za roboti (Robotics teams) zinazofundisha mifano ya uono (vision models) kwa kiwango kikubwa zinafurahia mizunguko ya marudio (iteration cycles) ya haraka zaidi, faida ambayo ni muhimu wakati muda wa majaribio ya ulimwengu halisi ni mdogo.
Upande mwingine wa sarafu
Nguvu zilezile zinazofanya Blackwell ivutie pia zinaweka mipaka katika soko lake la haraka.
Cha kufuatilia
- Mielekeo ya upokeaji (Adoption curves)
- Utayari wa mfumo wa programu (Software stack readiness)
- Uboreshaji wa gridi ya nguvu
Hitimisho
Blackwell inasukuma vifaa vya AI katika ngazi mpya ya utendaji wa hali ya juu, lakini pia inalazimisha uboreshaji wa sambamba wa mfumo unaozunguka (ecosystem).
