NVIDIA کی Blackwell GPU فیملی میں 208 ارب ٹرانزسٹرز موجود ہیں اور یہ 72-GPU ڈومین میں 130 TB/s تک کی بینڈوتھ فراہم کر سکتی ہے۔ یہ اقدام ٹریلین پیرامیٹر والے لینگویج ماڈلز کو نشانہ بناتا ہے جو جنریٹو-AI کی دوڑ پر حاوی ہیں، اور یہ ڈیٹا سینٹر آپریٹرز کو اس بات پر مجبور کرتا ہے کہ وہ رفتار کے فوائد حاصل کرنے سے پہلے پاور، کولنگ اور چیسس کے انتخاب پر نظر ثانی کریں۔
ہارڈ ویئر میں بڑی چھلانگ
Blackwell ایک کسٹم TSMC 4NP پروسیس استعمال کرتا ہے جو بہتر انرجی ایفیشنسی کے لیے خام کلاک اسپیڈ (raw clock speed) پر سمجھوتہ کرتا ہے۔ ہر GPU دو ڈائز (dies) پر مشتمل ہے جو 10 TB/s کے انٹرنل لنک کے ذریعے ایک ساتھ جڑے ہوئے ہیں، جس سے یہ جوڑا ایک سنگل لاجیکل پروسیسر کے طور پر کام کر سکتا ہے۔ یہ آرکیٹیکچر دوسری نسل کا Transformer Engine، پانچویں نسل کا NVLink اور NVLink Switch، نیز سیکیورٹی پر مرکوز بلاکس جیسے کہ confidential computing، Decompression Engine اور RAS (Reliability, Availability, Serviceability) فراہم کرتا ہے۔
سب سے نمایاں تبدیلی پریسیژن ہینڈلنگ (precision handling) میں ہے۔ Hopper کا H100 مکسڈ پریسیژن AI کاموں کے لیے FP8 پر انحصار کرتا تھا؛ Blackwell اب FP4 مائیکٹو-ٹینسر اسکیلنگ (micro-tensor scaling) پر آ گیا ہے۔ NVLink کا نیا ورژن GPU-to-GPU کمیونیکیشن کی حد کو بھی بڑھاتا ہے، جو ایک ہی فیبرک (fabric) میں 576 GPUs تک کو سپورٹ کرتا ہے اور NVIDIA کی بتائی گئی 130 TB/s کی رفتار فراہم کرتا ہے۔
عملی طور پر Hopper بمقابلہ Blackwell
| خصوصیت | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| بنیادی توجہ | مکسڈ AI اور HPC ورک لوڈز | بڑے لینگویج ماڈلز |
| پریسیژن | FP8 | FP4 مائیکرو-ٹینسر |
| انٹر کنیکٹ | 4th-gen NVLink | 5th-gen NVLink (576 GPUs تک) |
| ڈومین بینڈوتھ | – | 130 TB/s (72-GPU) |
| سیکیورٹی | اسٹینڈرڈ GPU I/O | TEE-I/O (trusted execution environment) کے ساتھ پہلا GPU |
یہ ٹیبل ظاہر کرتا ہے کہ Blackwell بڑے لینگویج ماڈلز پر توجہ مرکوز کرتا ہے۔
انفراسٹرکچر کی مشکلات
ایک سنگل Blackwell GPU لوڈ کے دوران 1 kW تک بجلی استعمال کر سکتا ہے، جو عام ڈیٹا سینٹر پاور ڈسٹری بیوشن کی حدود کو چیلنج کرتا ہے۔ ایئر کولنگ، جو زیادہ تر سرور گریڈ سلیکون کے لیے کارآمد ہوتی ہے، اس گرمی کو اتنی تیزی سے خارج نہیں کر سکتی؛ اس لیے لیکویڈ کولنگ لوپس (liquid-cooling loops) ایک لازمی ضرورت بن جاتے ہیں۔ اس کا فارم فیکٹر (form factor) پرانے چیسس میں فٹ ہونے سے بھی انکار کرتا ہے۔ NVIDIA کے اپنے HGX اور DGX پلیٹ فارمز ان سسٹمز کی مثالیں ہیں جو ان چپس کو ایڈجسٹ کر سکتے ہیں۔
کسے فائدہ ہوگا
- LLM ڈویلپرز کو تیز رفتار ٹریننگ اور فائن ٹیوننگ کا فائدہ ہوگا۔
- انفرنس کلسٹرز (Inference clusters) جو چیٹ کی طرز کی ایپلی کیشنز فراہم کرتے ہیں، وہ FP4 اسکیلنگ اور وسیع انٹر-GPU بینڈوتھ کی بدولت کم لیٹنسی (latency) اور زیادہ تھرو پٹ (throughput) حاصل کریں گے۔
- بگ ڈیٹا اینالیٹکس پائپ لائنز جو ٹرانسفارمر پر مبنی آگمنٹیشن یا خلاصہ نگاری پر انحصار کرتی ہیں، وہ زیادہ کاموں کو متوازی طور پر چلا سکیں گی۔
- روبوٹکس ٹیمیں جو بڑے پیمانے پر ویژن ماڈلز کی تربیت کرتی ہیں، وہ تیز تر ایٹریشن سائیکلز (iteration cycles) سے لطف اندوز ہوں گی، جو کہ اس وقت ایک بڑا فائدہ ہے جب حقیقی دنیا کے ٹیسٹنگ کے اوقات محدود ہوں۔
سکّے کا دوسرا رخ
وہی خوبیاں جو Blackwell کو پرکشش بناتی ہیں، اس کی فوری مارکیٹ کو محدود بھی کرتی ہیں۔
کن چیزوں پر نظر رکھنی چاہیے
- ایڈاپشن کرو (Adoption curves)
- سافٹ ویئر اسٹیک کی تیاری
- پاور گرڈ اپ گریڈز
خلاصہ
Blackwell AI ہارڈ ویئر کو خام کارکردگی (raw performance) کے ایک نئے درجے میں لے جاتا ہے، لیکن یہ ارد گرد کے ایکوسسٹم کی متوازی اپ گریڈ کے لیے بھی مجبور کرتا ہے۔
