NVIDIA ના Blackwell GPU ફેમિલીમાં 208 અબજ ટ્રાન્ઝિસ્ટર છે અને તે 72-GPU ડોમેનમાં 130 TB/s સુધીની બેન્ડવિડ્થ આપી શકે છે. આ પગલું એવા ટ્રિલિયન-પેરામીટર ધરાવતા લેંગ્વેજ મોડલ્સને લક્ષ્ય બનાવે છે જે જનરેટિવ-AI ની સ્પર્ધામાં પ્રભુત્વ ધરાવે છે અને ડેટા-સેન્ટર ઓપરેટરોને સ્પીડના ફાયદા મેળવતા પહેલા પાવર, કૂલિંગ અને ચેસિસના વિકલ્પો વિશે ફરીથી વિચારવા માટે મજબૂર કરે છે.

હાર્ડવેર ક્ષેત્રે મોટી છલાંગ

Blackwell એ કસ્ટમ TSMC 4NP પ્રોસેસનો ઉપયોગ કરે છે જે વધુ સારી ઉર્જા કાર્યક્ષમતા માટે ક્લોક સ્પીડનો ત્યાગ કરે છે. દરેક GPU માં બે ડાઇઝ (dies) હોય છે જે 10 TB/s ના ઇન્ટરનલ લિંક સાથે જોડાયેલા હોય છે, જે આ જોડીને સિંગલ લોજિકલ પ્રોસેસર તરીકે કાર્ય કરવા દે છે. આ આર્કિટેક્ચરમાં બીજી પેઢીનું Transformer Engine, પાંચમી પેઢીનું NVLink અને NVLink Switch, તેમજ કોન્ફિડેન્શિયલ કમ્પ્યુટિંગ (confidential computing) તરીકે ઓળખાતા સુરક્ષા-કેન્દ્રિત બ્લોક્સ, એક Decompression Engine અને RAS (Reliability, Availability, Serviceability) ઉમેરવામાં આવ્યા છે.

સૌથી મોટો દેખીતો ફેરફાર પ્રિસિઝન હેન્ડલિંગમાં છે. Hopper ના H100 મિશ્ર-પ્રિસિઝન AI કાર્ય માટે FP8 પર આધારિત હતા; Blackwell હવે FP4 માઇક્રો-ટેન્સર સ્કેલિંગ પર આવી ગયું છે. નવું NVLink વર્ઝન GPU-to-GPU કોમ્યુનિકેશનની ક્ષમતામાં પણ વધારો કરે છે, જે સિંગલ ફેબ્રિકમાં 576 GPU સુધીનું સપોર્ટ કરે છે અને NVIDIA દ્વારા જણાવેલ 130 TB/s ની આંકડો પૂરો પાડે છે.

પ્રેક્ટિકલમાં Hopper વિરુદ્ધ Blackwell

વિશેષતા Hopper (H100) Blackwell (B200)
મુખ્ય ધ્યાન મિશ્રિત AI અને HPC વર્કલોડ્સ મોટા લેંગ્વેજ મોડલ્સ
પ્રિસિઝન FP8 FP4 માઇક્રો-ટેન્સર
ઇન્ટરકનેક્ટ 4th-gen NVLink 5th-gen NVLink (576 GPU સુધી)
ડોમેન બેન્ડવિડ્થ 130 TB/s (72-GPU)
સુરક્ષા સ્ટાન્ડર્ડ GPU I/O TEE-I/O (trusted execution environment) ધરાવતું પ્રથમ GPU

આ કોષ્ટક દર્શાવે છે કે Blackwell મોટા લેંગ્વેજ મોડલ્સ પર ધ્યાન કેન્દ્રિત કરે છે.

ઇન્ફ્રાસ્ટ્રક્ચરની મુશ્કેલીઓ

એક સિંગલ Blackwell GPU લોડ હેઠળ 1 kW જેટલો પાવર વાપરી શકે છે, જે સામાન્ય ડેટા-સેન્ટર પાવર ડિસ્ટ્રિબ્યુશનની મર્યાદાઓ વધારી દે છે. એર કૂલિંગ, જે મોટાભાગના સર્વર-ગ્રેડ સિલિકોન માટે કામ કરે છે, તેટલી ઝડપથી ગરમી દૂર કરી શકતું નથી; લિક્વિડ-કૂલિંગ લૂપ્સ અનિવાર્ય બની જાય છે. આનું ફોર્મ ફેક્ટર પણ જૂના ચેસિસમાં ફિટ થતું નથી. NVIDIA ના પોતાના HGX અને DGX પ્લેટફોર્મ એવા સિસ્ટમોના ઉદાહરણો છે જે આ ચિપ્સને સમાવી શકે છે.

કોને ફાયદો થશે

  • LLM ડેવલપર્સ ને ઝડપી ટ્રેનિંગ અને ફાઇન-ટ્યુનિંગનો લાભ મળશે.
  • ઇન્ફરન્સ ક્લસ્ટર્સ જે ચેટ-પ્રકારની એપ્લિકેશન્સ પૂરી પાડે છે, તેઓ FP4 સ્કેલિંગ અને વિશાળ ઇન્ટર-GPU બેન્ડવિડ્થને કારણે ઓછી લેટન્સી અને વધુ થ્રુપુટનો અનુભવ કરશે.
  • બિગ-ડેટા એનાલિટિક્સ પાઇપલાઇન્સ જે ટ્રાન્સફોર્મર-આધારિત ઓગમેન્ટેશન અથવા સમરાઇઝેશન પર આધારિત છે, તેઓ વધુ જોબ્સ સમાંતર રીતે ચલાવી શકે છે.
  • રોબોટિક્સ ટીમો જે સ્કેલ પર વિઝન મોડલ્સ ટ્રેન કરે છે, તેઓ ઝડપી ઇટરેશન સાયકલનો લાભ મેળવી શકે છે, જે વાસ્તવિક દુનિયાના ટેસ્ટિંગ વિન્ડો જ્યારે મર્યાદિત હોય ત્યારે એક મોટો ફાય