NVIDIA का Blackwell GPU परिवार 208 बिलियन ट्रांजिस्टर से लैस है और 72-GPU डोमेन में 130 TB/s तक की बैंडविड्थ प्रदान कर सकता है। यह कदम उन ट्रिलियन-पैरामीटर वाले लैंग्वेज मॉडल्स को लक्षित करता है जो जनरेटिव-AI की दौड़ में हावी हैं, और डेटा-सेंटर ऑपरेटरों को गति का लाभ उठाने से पहले पावर, कूलिंग और चेसिस के विकल्पों पर पुनर्विचार करने के लिए मजबूर करता है।
हार्डवेयर में बड़ी छलांग
Blackwell एक कस्टम TSMC 4NP प्रोसेस का उपयोग करता है जो बेहतर ऊर्जा दक्षता (energy efficiency) के लिए रॉ क्लॉक स्पीड का त्याग करता है। प्रत्येक GPU में दो डाइज़ (dies) होते हैं जिन्हें 10 TB/s के इंटरनल लिंक के साथ जोड़ा गया है, जिससे यह जोड़ी एक सिंगल लॉजिकल प्रोसेसर के रूप में कार्य कर सकती है। यह आर्किटेक्चर दूसरी पीढ़ी का Transformer Engine, पांचवीं पीढ़ी का NVLink और NVLink Switch, साथ ही कॉन्फिडेंशियल कंप्यूटिंग (confidential computing) नामक सुरक्षा-केंद्रित ब्लॉक्स, एक डीकंप्रेशन इंजन और RAS (Reliability, Availability, Serviceability) जोड़ता है।
सबसे स्पष्ट बदलाव प्रिसिजन हैंडलिंग (precision handling) में है। Hopper के H100 मिक्स्ड-प्रिसिजन AI कार्यों के लिए FP8 पर निर्भर थे; Blackwell अब FP4 माइक्रो-टेंसर स्केलिंग का उपयोग करता है। नया NVLink वर्जन GPU-to-GPU संचार की सीमा को भी बढ़ाता है, जो एक सिंगल फैब्रिक में 576 GPUs तक का समर्थन करता है और NVIDIA द्वारा बताए गए 130 TB/s के आंकड़े को डिलीवर करता है।
व्यवहार में Hopper बनाम Blackwell
| विशेषता | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| मुख्य फोकस | मिक्स्ड AI और HPC वर्कलोड्स | लार्ज लैंग्वेज मॉडल्स |
| प्रिसिजन | FP8 | FP4 माइक्रो-टेंसर |
| इंटरकनेक्ट | 4th-gen NVLink | 5th-gen NVLink (576 GPUs तक) |
| डोमेन बैंडविड्थ | – | 130 TB/s (72-GPU) |
| सुरक्षा | स्टैंडर्ड GPU I/O | TEE-I/O (trusted execution environment) वाला पहला GPU |
यह तालिका दर्शाती है कि Blackwell लार्ज लैंग्वेज मॉडल्स पर केंद्रित है।
इंफ्रास्ट्रक्चर की मुश्किलें
एक सिंगल Blackwell GPU लोड के तहत 1 kW तक बिजली की खपत कर सकता है, जो विशिष्ट डेटा-सेंटर पावर डिस्ट्रीब्यूशन की सीमाओं को चुनौती देता है। एयर कूलिंग, जो अधिकांश सर्वर-ग्रेड सिलिकॉन के लिए काम करती है, उस गर्मी को पर्याप्त तेज़ी से बाहर नहीं निकाल सकती; ऐसे में लिक्विड-कूलिंग लूप्स एक आवश्यकता बन जाते हैं। इसका फॉर्म फैक्टर भी पुराने (legacy) चेसिस में फिट नहीं बैठता है। NVIDIA के अपने HGX और DGX प्लेटफॉर्म उन सिस्टम के उदाहरण हैं जो इन चिप्स को समाहित कर सकते हैं।
किसे लाभ होगा
- LLM डेवलपर्स को तेज़ ट्रेनिंग और फाइन-ट्यूनिंग का लाभ मिलता है।
- इन्फरेंस क्लस्टर्स (Inference clusters), जो चैट-टाइप एप्लिकेशन प्रदान करते हैं, उन्हें FP4 स्केलिंग और विशाल इंटर-GPU बैंडविड्थ के कारण कम लेटेंसी और उच्च थ्रूपुट मिलता है।
- बिग-डेटा एनालिटिक्स पाइपलाइन्स, जो ट्रांसफॉर्मर-आधारित ऑग्मेंटेशन या समराइजेशन पर निर्भर करती हैं, अधिक जॉब्स को समानांतर (parallel) में चला सकती हैं।
- रोबोटिक्स टीमें, जो बड़े पैमाने पर विजन मॉडल प्रशिक्षित करती हैं, तेज़ इटरेशन साइकिल का लाभ उठाती हैं, जो वास्तविक दुनिया के परीक्षण के सीमित समय में एक बड़ा फायदा है।
सिक्के का दूसरा पहलू
वही ताकतें जो Blackwell को आकर्षक बनाती हैं, उसके तत्काल बाजार को सीमित भी करती हैं।
किन बातों पर नज़र रखें
- एडॉप्शन कर्व्स (Adoption curves)
- सॉफ्टवेयर स्टैक की तैयारी
- पावर-ग्रिड अपग्रेड
निष्कर्ष
Blackwell AI हार्डवेयर को रॉ परफॉरमेंस के एक नए स्तर पर ले जाता है, लेकिन यह आसपास के इकोसिस्टम के समानांतर अपग्रेड के लिए भी मजबूर करता है।
