OpenAI חשפה את שבב ההסקה (inference) שלה, Jalapeño, וטוענת שהוא מספק עד פי 1.9 מהתפוקה (throughput) לכל קילוואט בהשוואה למאיצי ה-GB200 וה-GB300 של Nvidia. הצוות הפך קונספט לשבב סיליקון (die) עובד תוך תשעה חודשים — הרבה יותר מהמחזור הרגיל של שנתיים עד שלוש שנים עבור מעבדי AI מותאמים אישית.
למה המרוץ הזה חשוב
OpenAI מריצה כעת מודלים על חומרה מבית Cerebras, AWS Trainium, AMD ואחרים, במקום להסתמך אך ורק על מעבדי ה-GPU של Nvidia. ככל שעומסי העבודה ב-AI עוברים מאימון כבד להסקה כבדה, צריכת החשמל והעלות לכל שאילתה הופכות למכריעות. שבב שיכול לחצות את האנרגיה הנדרשת למודל עם טריליון פרמטרים עשוי לקצץ את הוצאות התפעול של שירותים המטפלים במיליארדי בקשות מדי יום.
איך ה-AI כתב את השבב
Jalapeño הוא ASIC — שבב שנבנה למטרה אחת בלבד: הרצת מודלי שפה גדולים (LLM). בניגוד ל-GPU בעל מטרה כללית, ASIC מסיר לוגיקה מיותרת ומתאים את נתיבי הנתונים לדפוסי ההסקה של LLM. המהנדסים של OpenAI כתבו את התכנון בשפת XLS, שפת תיאור חומרה המאפשרת למודלים של למידת מכונה לייצר קוד. החברה מציינת כי לוגיקה שנוצרה על ידי AI מהווה יותר ממחצית מהליבה של השבב, מה שמקצר את תהליך התכנון (design pipeline) משנים לחודשים.
טענות ביצועים מול מציאות
OpenAI מפרטת שלושה נתונים מרכזיים עבור Jalapeño:
- תפוקה לכל קילוואט: גבוהה בפי 1.5 – 1.9 מה-GB200/GB300 של Nvidia.
- שיהוי (latency): נמוך בפי 1.7 – 3.6 מהמודלים המקבילים של Nvidia.
- צריכת חשמל במודל של טריליון פרמטרים: 700W לעומת 1,400W ב-GB300.
אם הנתונים הללו יתבררו כנכונים, מרכז נתונים יוכל להריץ את אותו המודל בחצי מעלות החשמל תוך מתן תגובות מהירות יותר. הטענות מתמקדות בהסקה; OpenAI אינה מתייחסת לביצועי אימון, מה שמתיישב עם הדגש הנוכחי שלה על שירות אפליקציות מסוג צ'אט.
מה זה אומר על Nvidia
שבבי ה-Blackwell וה-Vera Rubin הקרובים של Nvidia מכוונים לשוק המאיצים היוקרתיים (high-end). היתרון של Nvidia טמון במחסנית תוכנה (software stack) בשלה, אימוץ נרחב על ידי מפתחים וגמישות במשימות AI שונות. Jalapeño, לעומת זאת, הוא מכשיר בעל מטרה צרה שמנצח רק כאשר עומס העבודה תואם להתמחות שלו.
הלחץ על Nvidia מגיע משני כיוונים. ראשית, לקוחות שיכולים להרשות לעצמם ASIC מותאם אישית עשויים לעבור אליו בשל החיסכון המובטח, מה שישחק את נתח השוק של Nvidia בתחום ההסקה. שנית, ההוכחה לכך ש-AI יכול לסייע בתכנון חומרה עשויה לדחוס את מחזורי הפיתוח של המתחרים, ובכך לאלץ את Nvidia להאיץ את מפת הדרכים שלה.
נקודות למחשבה ושאלות פתוחות
- אקוסיסטם תוכנה: ספריות ה-CUDA של Nvidia, כלי הפרופילינג (profiling) ותמיכת הקהילה עדיין מעניקים לה יתרון מכריע עבור רוב המפתחים. שילוב של Jalapeño ידרוש שרשראות כלים (toolchains) חדשות ואולי אף כתיבה מחדש של קוד.
- תיקוף בעולם האמיתי: המספרים מגיעים מבדיקות פנימיות של OpenAI. מבחני ביצועים (benchmarks) עצמאיים, נתוני אמינות לטווח ארוך והתנהגות התרחבות (scaling) תחת עומסי משתמשים מעורבים (mixed-tenant) נותרו ללא אימות.
- כלכלת קנה מידה (economics of scale): היתרון הכלכלי של ASIC גדל ככל שהנפח עולה. השימוש הפנימי של OpenAI עשוי להצדיק את ההשקעה, אך לקוחות חיצוניים עלולים להתמודד עם מחירים גבוהים יותר לשבב, אלא אם הייצור יתרחב.
מבט לעתיד
לעת עתה, Jalapeño מוכיח שמרוץ של תשעה חודשים יכול להניב שבב שעל הנייר עולה בביצועיו על ה-GPU הקיים בחלק הרגיש ביותר מבחינת עלות במחסנית ה-AI. המבחן האמיתי יהיה האם היתרון הזה ישרד את העבודה המאומצת של עומסי עבודה בעולם האמיתי.
