NVIDIA-এর Blackwell GPU পরিবারে রয়েছে ২০৮ বিলিয়ন ট্রানজিস্টর এবং এটি একটি ৭২-GPU ডোমেইনে ১৩০ TB/s পর্যন্ত ব্যান্ডউইথ প্রদান করতে পারে। এই পদক্ষেপটি মূলত ট্রিলিয়ন-প্যারামিটার বিশিষ্ট ল্যাঙ্গুয়েজ মডেলগুলোকে লক্ষ্য করে তৈরি করা হয়েছে যা জেনারেটিভ-AI দৌড়ে আধিপত্য বিস্তার করছে; এর ফলে ডেটা-সেন্টার অপারেটরদের এই গতির সুবিধা পাওয়ার আগে বিদ্যুৎ সরবরাহ, কুলিং এবং চ্যাসিস (chassis) সংক্রান্ত সিদ্ধান্তগুলো পুনরায় বিবেচনা করতে হচ্ছে।

হার্ডওয়্যারের বিশাল অগ্রগতি

Blackwell একটি কাস্টম TSMC 4NP প্রসেস ব্যবহার করে যা উন্নত এনার্জি এফিসিয়েন্সির (energy efficiency) জন্য র (raw) ক্লক স্পিড কিছুটা কমিয়ে দেয়। প্রতিটি GPU দুটি ডাই (die) নিয়ে গঠিত যা একটি ১০ TB/s ইন্টারনাল লিঙ্কের মাধ্যমে যুক্ত থাকে, ফলে এই জোড়াটি একটি একক লজিক্যাল প্রসেসর হিসেবে কাজ করতে পারে। এই আর্কিটেকচারে রয়েছে দ্বিতীয় প্রজন্মের Transformer Engine, পঞ্চম প্রজন্মের NVLink এবং NVLink Switch, সেইসাথে সিকিউরিটি-ফোকাসড ব্লক যেমন confidential computing, একটি Decompression Engine এবং RAS (Reliability, Availability, Serviceability)।

সবচেয়ে দৃশ্যমান পরিবর্তনটি হলো প্রিসিশন হ্যান্ডলিং (precision handling)। Hopper-এর H100 মিক্সড-প্রিসিশন AI কাজের জন্য FP8-এর ওপর নির্ভর করত; Blackwell এখন FP4 micro-tensor স্কেলিংয়ে নেমে এসেছে। নতুন NVLink ভার্সনটি GPU-to-GPU কমিউনিকেশনের সক্ষমতাও বাড়িয়ে দিয়েছে, যা একটি সিঙ্গেল ফ্যাব্রিকে ৫৭৬টি GPU পর্যন্ত সাপোর্ট করে এবং NVIDIA-এর উল্লিখিত ১৩০ TB/s ব্যান্ডউইথ প্রদান করে।

ব্যবহারিক ক্ষেত্রে Hopper বনাম Blackwell

বৈশিষ্ট্য Hopper (H100) Blackwell (B200)
প্রাথমিক লক্ষ্য মিক্সড AI এবং HPC ওয়ার্কলোড লার্জ ল্যাঙ্গুয়েজ মডেল
প্রিসিশন FP8 FP4 micro-tensor
ইন্টারকানেক্ট 4th-gen NVLink 5th-gen NVLink (৫৭৬টি GPU পর্যন্ত)
ডোমেইন ব্যান্ডউইথ ১৩০ TB/s (৭২-GPU)
সিকিউরিটি স্ট্যান্ডার্ড GPU I/O TEE-I/O (trusted execution environment) যুক্ত প্রথম GPU

টেবিলটি দেখায় যে Blackwell লার্জ ল্যাঙ্গুয়েজ মডেলের ওপর গুরুত্ব দেয়।

অবকাঠামোগত জটিলতা

একটি একক Blackwell GPU লোডের সময় ১ kW পর্যন্ত বিদ্যুৎ খরচ করতে পারে, যা সাধারণ ডেটা-সেন্টারের বিদ্যুৎ বণ্টন ব্যবস্থার সীমা ছাড়িয়ে যায়। এয়ার কুলিং (Air cooling), যা বেশিরভাগ সার্ভার-গ্রেড সিলিকনের জন্য কার্যকর, তা এই তাপ দ্রুত সরিয়ে ফেলতে পারে না; ফলে লিকুইড-কুলিং লুপ (liquid-cooling loops) একটি অপরিহার্য শর্ত হয়ে দাঁড়িয়েছে। এর ফর্ম ফ্যাক্টরটিও পুরনো চ্যাসিসে (legacy chassis) ফিট হয় না। NVIDIA-এর নিজস্ব HGX এবং DGX প্ল্যাটফর্মগুলো হলো এমন সিস্টেমের উদাহরণ যা এই চিপগুলোকে ধারণ করতে পারে।

কারা উপকৃত হবে

  • LLM ডেভেলপাররা দ্রুত ট্রেনিং এবং ফাইন-টিউনিংয়ের সুবিধা পাবেন।
  • চ্যাট-টাইপ অ্যাপ্লিকেশন সার্ভিস প্রদানকারী Inference ক্লাস্টারগুলো FP4 স্কেলিং এবং বিশাল ইন্টার-GPU ব্যান্ডউইথের কারণে কম ল্যাটেন্সি এবং উচ্চ থ্রুপুট (throughput) পাবে।
  • বিগ-ডেটা অ্যানালিটিক্স পাইপলাইনগুলো, যা ট্রান্সফরমার-ভিত্তিক অগমেন্টেশন বা সামারাইজেশনের ওপর নির্ভর করে, তারা আরও বেশি জব প্যারালালি (parallel) চালাতে পারবে।
  • রোবোটিক্স টিমগুলো যারা বড় পরিসরে ভিশন মডেল ট্রেনিং করছে, তারা দ্রুত ইটারেশন সাইকেল (iteration cycles) উপভোগ করবে, যা বাস্তব জগতের পরীক্ষার সীমিত সময়ের ক্ষেত্রে একটি বড় সুবিধা।

মুদ্রার উল্টো পিঠ

যে শক্তিগুলো Blackwell-কে আকর্ষণীয় করে তোলে, সেগুলোই এর তাৎক্ষণিক বাজারকেও সীমাবদ্ধ করে দেয়।

যা নজরদারিতে রাখতে হবে

  • অ্যাডপশন কার্ভ (Adoption curves)
  • সফটওয়্যার স্ট্যাকের প্রস্তুতি
  • পাওয়ার-গ্রিড আপগ্রেড

সারসংক্ষেপ

Blackwell AI হার্ডওয়্যারকে র (raw) পারফরম্যান্সের এক নতুন স্তরে নিয়ে গেছে, তবে এটি আশেপাশের ইকোসিস্টেমকেও সমান্তরালভাবে আপগ্রেড করতে বাধ্য করছে।