משפחת ה-GPU מסדרת Blackwell של NVIDIA כוללת 208 מיליארד טרנזיסטורים ויכולה לספק רוחב פס של עד 130 TB/s בדומיין של 72 מעבדי GPU. המהלך מכוון למודלי שפה עם טריליון פרמטרים השולטים במרוץ ה-AI הגנרטיבי, ומאלץ מפעילים של מרכזי נתונים לחשוב מחדש על בחירות צריכת החשמל, הקירור והמארזים לפני שיוכלו לקצור את רווחי המהירות.

הקפיצה בחומרה

Blackwell משתמשת בתהליך TSMC 4NP מותאם אישית המקריב מהירות שעון גולמית לטובת יעילות אנרגטית טובה יותר. כל GPU מורכב משני dies המחוברים יחד באמצעות קישור פנימי של 10 TB/s, מה שמאפשר לצמד לפעול כמעבד לוגי יחיד. הארכיטקטורה מוסיפה מנוע Transformer מהדור השני, NVLink ו-NVLink Switch מהדור החמישי, בנוסף לבלוקים ממוקדי אבטחה הנקראים confidential computing, מנוע דחיסה (Decompression Engine) ו-RAS (אמינות, זמינות ושירותיות).

השינוי הבולט ביותר הוא בניהול הדיוק. ה-H100 מסדרת Hopper התבסס על FP8 לעבודות AI בדיוק מעורב; Blackwell עוברת לשימוש ב-FP4 micro-tensor scaling. גרסת ה-NVLink החדשה מעלה גם היא את התקרה לתקשורת בין GPU ל-GPU, עם תמיכה בעד 576 מעבדי GPU ב-fabric יחיד, ומספקת את נתון ה-130 TB/s שצוין על ידי NVIDIA.

Hopper לעומת Blackwell בפועל

תכונה Hopper (H100) Blackwell (B200)
מיקוד עיקרי עומסי עבודה מעורבים של AI ו-HPC מודלי שפה גדולים
דיוק FP8 FP4 micro-tensor
קישוריות (Interconnect) NVLink דור 4 NVLink דור 5 (עד 576 מעבדי GPU)
רוחב פס בדומיין 130 TB/s (72-GPU)
אבטחה I/O סטנדרטי של GPU ה-GPU הראשון עם TEE-I/O (סביבת ביצוע מהימנה)

הטבלה מראה ש-Blackwell מתמקדת במודלי שפה גדולים.

כאבי ראש בתשתית

מעבד Blackwell בודד יכול לצרוך עד 1 kW תחת עומס, מה שדוחק את גבולות חלוקת החשמל הטיפוסית במרכזי נתונים. קירור אוויר, שעובד עבור רוב השבבים ברמת שרתים, אינו יכול לפזר את החום הזה מהר מספיק; לולאות קירור נוזלי הופכות לדרישת קדם. גם גורם הצורה (form factor) מסרב להתאים למארזים (chassis) ישנים. פלטפורמות ה-HGX וה-DGX של NVIDIA עצמה הן דוגמאות למערכות שיכולות להכיל את השבבים הללו.

מי מרוויח

  • מפתחי LLM מרוויחים מאימון וכוונון (fine-tuning) מהירים יותר.
  • אשכולות inference המשרתים אפליקציות מסוג צ'אט נהנים משיהוי (latency) נמוך יותר וקצב העברת נתונים (throughput) גבוה יותר הודות לשימוש ב-FP4 scaling וברוחב פס עצום בין מעבדי ה-GPU.
  • צינורות (pipelines) של אנליטיקת Big-data המסתמכים על הרחבה (augmentation) או סיכום מבוססי transformer יכולים להריץ יותר משימות במקביל.
  • צוותי רובוטיקה המאמנים מודלי ראייה ממוחשבת בקנה מידה