NVIDIA-യുടെ Blackwell GPU കുടുംബത്തിൽ 208 ബില്യൺ ട്രാൻസിസ്റ്ററുകൾ അടങ്ങിയിരിക്കുന്നു, കൂടാതെ ഒരു 72-GPU ഡൊമെയ്നിൽ 130 TB/s വരെ ബാൻഡ്‌വിഡ്ത്ത് നൽകാനും ഇതിന് കഴിയും. ജനറേറ്റീവ് AI മത്സരത്തിൽ മുന്നിൽ നിൽക്കുന്ന ട്രില്യൺ പാരാമീറ്റർ ഭാഷാ മാതൃകകളെ (language models) ലക്ഷ്യമിട്ടാണ് ഈ നീക്കം. ഈ വേഗതയുടെ ഗുണങ്ങൾ ലഭിക്കുന്നതിന് മുമ്പ് പവർ, കൂളിംഗ്, ചേസിസ് (chassis) എന്നിവയെക്കുറിച്ചുള്ള തീരുമാനങ്ങൾ പുനർചിന്തനം ചെയ്യാൻ ഇത് ഡാറ്റാ സെന്റർ ഓപ്പറേറ്റർമാരെ നിർബന്ധിതരാക്കുന്നു.

ഹാർഡ്‌വെയറിലെ കുതിച്ചുചാട്ടം

Blackwell മികച്ച ഊർജ്ജ കാര്യക്ഷമതയ്ക്കായി ക്ലോക്ക് സ്പീഡിൽ വിട്ടുവീഴ്ച ചെയ്യുന്ന കസ്റ്റം TSMC 4NP പ്രോസസ്സ് ഉപയോഗിക്കുന്നു. ഓരോ GPU-വും 10 TB/s ഇന്റേണൽ ലിങ്ക് ഉപയോഗിച്ച് കൂട്ടിയിണക്കിയ രണ്ട് ഡൈകൾ (dies) ചേർന്നതാണ്, ഇത് ജോഡിയെ ഒരു സിംഗിൾ ലോജിക്കൽ പ്രോസസ്സറായി പ്രവർത്തിപ്പിക്കാൻ അനുവദിക്കുന്നു. ഈ ആർക്കിടെക്ചറിൽ രണ്ടാം തലമുറ Transformer Engine, അഞ്ചാം തലമുറ NVLink, NVLink Switch എന്നിവയ്‌ക്കൊപ്പം കോൺഫിഡൻഷ്യൽ കമ്പ്യൂട്ടിംഗ് (confidential computing) പോലുള്ള സുരക്ഷാ കേന്ദ്രീകൃത ബ്ലോക്കുകൾ, ഒരു ഡീകംപ്രഷൻ എൻജിൻ, RAS (Reliability, Availability, Serviceability) എന്നിവയും ഉൾപ്പെടുന്നു.

ഏറ്റവും പ്രകടമായ മാറ്റം പ്രിസിഷൻ കൈകാര്യം ചെയ്യുന്നതിലാണ്. Hopper-ന്റെ H100 മിക്സഡ്-പ്രിസിഷൻ AI ജോലികൾക്കായി FP8-നെയാണ് ആശ്രയിച്ചിരുന്നത്; എന്നാൽ Blackwell FP4 മൈക്രോ-ടെൻസർ സ്കെയിലിംഗിലേക്ക് മാറുന്നു. പുതിയ NVLink പതിപ്പ് GPU-കൾ തമ്മിലുള്ള ആശയവിനിമയത്തിന്റെ പരിധി വർദ്ധിപ്പിക്കുകയും, ഒരൊറ്റ ഫാബ്രിക്‌ನಲ್ಲಿ 576 GPU വരെ പിന്തുണയ്ക്കുകയും ചെയ്യുന്നു, ഇത് NVIDIA പ്രസ്താവിച്ച 130 TB/s ബാൻഡ്‌വിഡ്ത്ത് നൽകുന്നു.

പ്രായോഗികമായി Hopper vs. Blackwell

സവിശേഷത Hopper (H100) Blackwell (B200)
പ്രധാന ലക്ഷ്യം മിക്സഡ് AI, HPC വർക്ക്ലോഡുകൾ വലിയ ഭാഷാ മാതൃകകൾ (Large language models)
പ്രിസിഷൻ FP8 FP4 മൈക്രോ-ടെൻസർ
ഇന്റർകണക്ട് 4th-gen NVLink 5th-gen NVLink (576 GPU വരെ)
ഡൊമെയ്ൻ ബാൻഡ്‌വിഡ്ത്ത് 130 TB/s (72-GPU)
സുരക്ഷ സ്റ്റാൻഡേർഡ് GPU I/O TEE-I/O (trusted execution environment) ഉള്ള ആദ്യ GPU

ഈ പട്ടിക കാണിക്കുന്നത് Blackwell വലിയ ഭാഷാ മാതൃകകളിലാണ് (large language models) ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത് എന്നാണ്.

ഇൻഫ്രാസ്ട്രക്ചർ വെല്ലുവിളികൾ

ഒരു സിംഗിൾ Blackwell GPU ലോഡ് സമയത്ത് 1 kW വരെ വൈദ്യുതി ഉപയോഗിച്ചേക്കാം, ഇത് സാധാരണ ഡാറ്റാ സെന്ററുകളുടെ പവർ ഡിസ്ട്രിബ്യൂഷൻ പരിധികളെ വെല്ലുവിളിക്കുന്നു. മിക്ക സെർവർ ഗ്രേഡ് സിലിക്കണുകൾക്കും അനുയോജ്യമായ എയർ കൂളിംഗിന് ആ ചൂട് വേഗത്തിൽ പുറന്തള്ളാൻ കഴിയില്ല; അതിനാൽ ലിക്വിഡ് കൂളിംഗ് ലൂപ്പുകൾ അനിവാര്യമായി മാറുന്നു. കൂടാതെ, ഇതിന്റെ ഫോം ഫാക്ടർ പഴയ ചേസിസുകളിൽ (legacy chassis) ഉൾക്കൊള്ളാൻ കഴിയില്ല. ഈ ചിപ്പുകൾ ഉൾക്കൊള്ളാൻ കഴിയുന്ന സിസ്റ്റങ്ങൾക്ക് ഉദാഹരണമാണ് NVIDIA-യുടെ സ്വന്തം HGX, DGX പ്ലാറ്റ്‌ഫോമുകൾ.

ആർക്കൊക്കെ പ്രയോജനം ലഭിക്കും

  • LLM ഡെവലപ്പർമാർക്ക് വേഗത്തിലുള്ള ട്രെയിനിംഗും ഫൈൻ ട്യൂനിംഗും ലഭിക്കുന്നു.
  • ചാറ്റ് രീതിയിലുള്ള ആപ്ലിക്കേഷനുകൾ ഉപയോഗിക്കുന്ന ഇൻഫറൻസ് ക്ലസ്റ്ററുകൾക്ക് FP4 സ്കെയിലിംഗും വൻതോതിലുള്ള ഇന്റർ-GPU ബാൻഡ്‌വിഡത്തും കാരണം കുറഞ്ഞ ലേറ്റൻസിയും ഉയർന്ന ത്രൂപുട്ടും ലഭിക്കുന്നു.
  • ട്രാൻസ്ഫോർമർ അധിഷ്ഠിത ഓഗ്മെന്റേഷൻ അല്ലെങ്കിൽ സമ്മറൈസേഷൻ ഉപയോഗിക്കുന്ന ബിഗ് ഡാറ്റ അനലിറ്റിക്സ് പൈപ്പ്‌ലൈനുകൾക്ക് കൂടുതൽ ജോലികൾ സമാന്തരമായി പ്രവർത്തിപ്പിക്കാൻ കഴിയും.
  • വലിയ തോതിൽ വിഷൻ മോഡലുകൾ പരിശീലിപ്പിക്കുന്ന റോബോട്ടിക്സ് ടീമുകൾക്ക് വേഗത്തിലുള്ള ഇറ്ററേഷൻ സൈക്കിളുകൾ ലഭിക്കുന്നു; യഥാർത്ഥ ലോക പരീക്ഷണങ്ങൾക്കുള്ള സമയം പരിമിതമായ സാഹചര്യത്തിൽ ഇത് വലിയൊരു നേട്ടമാണ്.

മറ്റൊരു വശം

Blackwell-നെ ആകർഷകമാക്കുന്ന അതേ കരുത്തുകൾ തന്നെ അതിന്റെ ഉടനടിയുള്ള വിപണിയെ പരിമിതപ്പെടുത്തുകയും ചെയ്യുന്നു.

ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • സ്വീകാര്യതയുടെ തോത് (Adoption curves)
  • സോഫ്റ്റ്‌വെയർ സ്റ്റാക്ക് തയ്യാറെടുപ്പ്
  • പവർ ഗ്രിഡ് നവീകരണം

ചുരുക്കത്തിൽ

Blackwell AI ഹാർഡ്‌വെയറിനെ മികച്ച പ്രകടനത്തിന്റെ പുതിയ തലത്തിലേക്ക് എത്തിക്കുന്നു, എന്നാൽ ഇത് ചുറ്റുമുള്ള ഇക്കോസിസ്റ്റത്തിന്റെ സമാന്തരമായ നവീകരണത്തിനും കാരണമാകുന്നു.