خانواده پردازندههای گرافیکی Blackwell شرکت NVIDIA شامل ۲۰۸ میلیارد ترانزیستور است و میتواند در یک قلمرو ۷۲ پردازنده گرافیکی، پهنای باند تا ۱۳۰ ترابایت بر ثانیه را ارائه دهد. این حرکت، مدلهای زبانی با تریلیونها پارامتر را هدف قرار داده است که بر رقابت هوش مصنوعی مولد تسلط دارند و اپراتورهای مرکز داده را مجبور میکند پیش از بهرهمندی از مزایای سرعت، در انتخابهای مربوط به توان، خنکسازی و شاسی بازنگری کنند.
جهش سختافزاری
Blackwell از فرآیند سفارشی TSMC 4NP استفاده میکند که سرعت کلاک خام را فدای بهرهوری انرژی بهتر میکند. هر GPU از دو Die تشکیل شده است که با یک لینک داخلی ۱۰ ترابایت بر ثانیه به هم متصل شدهاند و به این زوج اجازه میدهند تا مانند یک پردازنده منطقی واحد عمل کنند. این معماری شامل نسل دوم Transformer Engine، نسل پنجم NVLink و NVLink Switch، و همچنین بلوکهای متمرکز بر امنیت مانند confidential computing، یک موتور فشردهسازی (Decompression Engine) و RAS (قابلیت اطمینان، در دسترس بودن و سرویسپذیری) است.
ملموسترین تغییر، مدیریت دقت (precision) است. معماری Hopper در مدل H100 برای کارهای هوش مصنوعی با دقت ترکیبی، بر FP8 متکی بود؛ اما Blackwell به مقیاسبندی میکرو-تنسور FP4 کاهش یافته است. نسخه جدید NVLink نیز سقف ارتباطات GPU-to-GPU را بالا میبرد و از حداکثر ۵۷۶ پردازنده گرافیکی در یک شبکه (fabric) واحد پشتیبانی میکند و رقم ۱۳۰ ترابایت بر ثانیه ذکر شده توسط NVIDIA را ارائه میدهد.
مقایسه Hopper و Blackwell در عمل
| ویژگی | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| تمرکز اصلی | بارهای کاری ترکیبی هوش مصنوعی و HPC | مدلهای زبانی بزرگ |
| دقت | FP8 | میکرو-تنسور FP4 |
| اتصال داخلی (Interconnect) | نسل چهارم NVLink | نسل پنجم NVLink (تا ۵۷۶ پردازنده گرافیکی) |
| پهنای باند قلمرو | – | ۱۳۰ ترابایت بر ثانیه (۷۲ پردازنده گرافیکی) |
| امنیت | ورودی/خروجی استاندارد GPU | اولین GPU با TEE-I/O (محیط اجرای مورد اعتماد) |
این جدول نشان میدهد که Blackwell بر مدلهای زبانی بزرگ تمرکز دارد.
چالشهای زیرساختی
یک پردازنده گرافیکی Blackwell میتواند تحت بار، تا ۱ کیلووات برق مصرف کند که محدودیتهای توزیع توان در مراکز داده معمولی را به چالش میکشد. خنکسازی با هوا، که برای اکثر تراشههای سطح سرور کارآمد است، نمیتواند این گرما را با سرعت کافی دفع کند؛ بنابراین حلقههای خنککننده مایع به یک پیشنیاز تبدیل میشوند. فرم فاکتور این تراشهها نیز در شاسیهای قدیمی جای نمیگیرد. پلتفرمهای HGX و DGX خودِ NVIDIA نمونههایی از سیستمهایی هستند که میتوانند این تراشهها را در خود جای دهند.
چه کسانی سود میبرند
- توسعهدهندگان LLM: آموزش و تنظیم دقیق (fine-tuning) سریعتر را تجربه میکنند.
- خوشههای استنتاج (Inference clusters): در سرویسدهی به اپلیکیشنهای چتمحور، به لطف مقیاسبندی FP4 و پهنای باند عظیم بین پردازندهها، تأخیر کمتر و توان عملیاتی بالاتری خواهند داشت.
- خطوط لوله تحلیل دادههای بزرگ: که به تقویت یا خلاصهسازی مبتنی بر ترنسفورمر متکی هستند، میتوانند وظایف بیشتری را به صورت موازی اجرا کنند.
- تیمهای رباتیک: که مدلهای بینایی را در مقیاس بزرگ آموزش میدهند، از چرخههای تکرار سریعتر بهره میبرند؛ مزیتی که در زمانهای محدودِ تست در دنیای واقعی، بسیار حیاتی است.
روی دیگر سکه
همان نقاط قوتی که Blackwell را جذاب میکنند، بازار فوری آن را نیز محدود میسازند.
چه مواردی را باید زیر نظر داشت
- منحنیهای پذیرش
- آمادگی پشته نرمافزاری (Software stack)
- ارتقای شبکه برق
نتیجهگیری
Blackwell سختافزار هوش مصنوعی را به سطح جدیدی از عملکرد خام میبرد، اما همزمان ارتقای موازی اکوسیستم اطراف آن را نیز تحمیل میکند.
