خانواده پردازنده‌های گرافیکی Blackwell شرکت NVIDIA شامل ۲۰۸ میلیارد ترانزیستور است و می‌تواند در یک قلمرو ۷۲ پردازنده گرافیکی، پهنای باند تا ۱۳۰ ترابایت بر ثانیه را ارائه دهد. این حرکت، مدل‌های زبانی با تریلیون‌ها پارامتر را هدف قرار داده است که بر رقابت هوش مصنوعی مولد تسلط دارند و اپراتورهای مرکز داده را مجبور می‌کند پیش از بهره‌مندی از مزایای سرعت، در انتخاب‌های مربوط به توان، خنک‌سازی و شاسی بازنگری کنند.

جهش سخت‌افزاری

Blackwell از فرآیند سفارشی TSMC 4NP استفاده می‌کند که سرعت کلاک خام را فدای بهره‌وری انرژی بهتر می‌کند. هر GPU از دو Die تشکیل شده است که با یک لینک داخلی ۱۰ ترابایت بر ثانیه به هم متصل شده‌اند و به این زوج اجازه می‌دهند تا مانند یک پردازنده منطقی واحد عمل کنند. این معماری شامل نسل دوم Transformer Engine، نسل پنجم NVLink و NVLink Switch، و همچنین بلوک‌های متمرکز بر امنیت مانند confidential computing، یک موتور فشرده‌سازی (Decompression Engine) و RAS (قابلیت اطمینان، در دسترس بودن و سرویس‌پذیری) است.

ملموس‌ترین تغییر، مدیریت دقت (precision) است. معماری Hopper در مدل H100 برای کارهای هوش مصنوعی با دقت ترکیبی، بر FP8 متکی بود؛ اما Blackwell به مقیاس‌بندی میکرو-تنسور FP4 کاهش یافته است. نسخه جدید NVLink نیز سقف ارتباطات GPU-to-GPU را بالا می‌برد و از حداکثر ۵۷۶ پردازنده گرافیکی در یک شبکه (fabric) واحد پشتیبانی می‌کند و رقم ۱۳۰ ترابایت بر ثانیه ذکر شده توسط NVIDIA را ارائه می‌دهد.

مقایسه Hopper و Blackwell در عمل

ویژگی Hopper (H100) Blackwell (B200)
تمرکز اصلی بارهای کاری ترکیبی هوش مصنوعی و HPC مدل‌های زبانی بزرگ
دقت FP8 میکرو-تنسور FP4
اتصال داخلی (Interconnect) نسل چهارم NVLink نسل پنجم NVLink (تا ۵۷۶ پردازنده گرافیکی)
پهنای باند قلمرو ۱۳۰ ترابایت بر ثانیه (۷۲ پردازنده گرافیکی)
امنیت ورودی/خروجی استاندارد GPU اولین GPU با TEE-I/O (محیط اجرای مورد اعتماد)

این جدول نشان می‌دهد که Blackwell بر مدل‌های زبانی بزرگ تمرکز دارد.

چالش‌های زیرساختی

یک پردازنده گرافیکی Blackwell می‌تواند تحت بار، تا ۱ کیلووات برق مصرف کند که محدودیت‌های توزیع توان در مراکز داده معمولی را به چالش می‌کشد. خنک‌سازی با هوا، که برای اکثر تراشه‌های سطح سرور کارآمد است، نمی‌تواند این گرما را با سرعت کافی دفع کند؛ بنابراین حلقه‌های خنک‌کننده مایع به یک پیش‌نیاز تبدیل می‌شوند. فرم فاکتور این تراشه‌ها نیز در شاسی‌های قدیمی جای نمی‌گیرد. پلتفرم‌های HGX و DGX خودِ NVIDIA نمونه‌هایی از سیستم‌هایی هستند که می‌توانند این تراشه‌ها را در خود جای دهند.

چه کسانی سود می‌برند

  • توسعه‌دهندگان LLM: آموزش و تنظیم دقیق (fine-tuning) سریع‌تر را تجربه می‌کنند.
  • خوشه‌های استنتاج (Inference clusters): در سرویس‌دهی به اپلیکیشن‌های چت‌محور، به لطف مقیاس‌بندی FP4 و پهنای باند عظیم بین پردازنده‌ها، تأخیر کمتر و توان عملیاتی بالاتری خواهند داشت.
  • خطوط لوله تحلیل داده‌های بزرگ: که به تقویت یا خلاصه‌سازی مبتنی بر ترنسفورمر متکی هستند، می‌توانند وظایف بیشتری را به صورت موازی اجرا کنند.
  • تیم‌های رباتیک: که مدل‌های بینایی را در مقیاس بزرگ آموزش می‌دهند، از چرخه‌های تکرار سریع‌تر بهره می‌برند؛ مزیتی که در زمان‌های محدودِ تست در دنیای واقعی، بسیار حیاتی است.

روی دیگر سکه

همان نقاط قوتی که Blackwell را جذاب می‌کنند، بازار فوری آن را نیز محدود می‌سازند.

چه مواردی را باید زیر نظر داشت

  • منحنی‌های پذیرش
  • آمادگی پشته نرم‌افزاری (Software stack)
  • ارتقای شبکه برق

نتیجه‌گیری

Blackwell سخت‌افزار هوش مصنوعی را به سطح جدیدی از عملکرد خام می‌برد، اما همزمان ارتقای موازی اکوسیستم اطراف آن را نیز تحمیل می‌کند.