דגשים בבדיקות הביצועים

כנס Hot Chips חשף נתונים שאומתו על ידי חברה עצמאית באמצעות חבילת InferenceX. OpenAI מגדירה את Jalapeño כמאיץ הסקה (inference) רב-תכליתי — הוא מריץ מודלים אך אינו מאמן אותם. בבדיקות, השבב:

  • סיפק 1.5 עד 1.9 יותר עבודה לכל וואט בתפוקת שיא לעומת המובילים כיום.
  • צמצם את השיהוי (latency) ב-1.7 עד 3.6, עם שיפורים באינטראקציה של 2.1 עד 4.1.

תוצאות לפי מודלים ספציפיים:

  • GPT-OSS 120B: ~1,400 טוקנים/שנייה/משתמש.
  • Deepseek R1 670B: ~700 טוקנים/שנייה בבקשה מקבילית בודדת.
  • Kimi K2.5 1T: נבדק בחבילת הביצועים הגבוהים (המספרים המדויקים נשמרו בסוד).

OpenAI הדגישה כי נתונים אלו הושגו ללא פענוח ספקולטיבי (speculative decoding) או חיזוי מרובה-טוקנים (multi-token prediction) — טריקים שרבים מהמתחרים משתמשים בהם כדי להגדיל את המספרים המרכזיים.

כיצד נבנה Jalapeño

OpenAI השלימה את תכנון השבב בתוך תשעה חודשים, בשיתוף פעולה עם Broadcom. החברה הזינה את המודלים שלה לתוך לולאת התכנון, מה שזרז את שלבי התכנון (blueprinting), התכנות והאופטימיזציה — שיטה המכונה "תכנון סיליקון בסיוע AI". המרוץ המהיר מדגיש מעבר ממחזורי הפיתוח של שנים רבות שמאפיינים בעבר שבבי ביצועים גבוהים.

ההשלכות על ההובלה של Nvidia

Nvidia נשענת על ביצועים גולמיים ועל אקוסיסטם CUDA. הנתונים החדשים הופכים את היתרון בביצועים לניתן לערעור. אנליסטים מזהירים כי אם יותר חברות AI ישיקו שבבי הסקה מותאמים אישית בעלי יעילות דומה, מפתחים עשויים להתרחק מ-CUDA, מה שיפתח מקום למחסניות (stacks) חלופיות ולשוק מפוצל.

האסטרטגיה המעורבת של OpenAI

סמנכ"לית הכספים, קלי הונג (Kelly Huang), הגדירה את Jalapeño כחלק מתוכנית מחשוב רחבה יותר, ולא כתחליף מלא לשותפים הקיימים. OpenAI עדיין עובדת עם Nvidia, AMD, AWS ו-Cerebras במגוון עומסי עבודה. Jalapeño נותר דוגמה הנדסית (engineering sample); הוא טרם התמודד עם המודלים הגדולים ביותר שעומדים להגיע, כמו Deepseek V4 Pro. דבריה של הונג מרמזים ש-OpenAI תשלב את הסיליקון שלה עם מאיצים מצד שלישי, במטרה לרדוף אחר השילוב הטוב ביותר של עלות-ביצועים עבור כל משימה.

נקודות למחשבה

דוגמאות בשלבים מוקדמים אינן מבטיחות ייצור המוני, תפוקת ייצור (yields) או אמינות לטווח ארוך, לכן יש לרסן את ההתלהבות.

מה כדאי לעקוב אחריו בהמשך

  • פריסה לייצור: האם OpenAI תוכל להפוך את Jalapeño לרכיב המיוצר בהמוני, ובאיזה מחיר?
  • מחסנית תוכנה (Software stack): עד כמה מודל התכנות ושרשרת הכלים (toolchain) יהיו בשלים עבור מפתחים?
  • תגובת המתחרים: כיצד Nvidia וספקים אחרים ישנו את מפות הדרכים (roadmaps) או את התמחור שלהם כדי להגן על נתח השוק?
  • הרחבת מודלים (Model scaling): האם Jalapeño ישמור על יתרונו מול הגל הבא של מודלים בעלי טריליון פרמטרים?

שורה תחתונה: שבבי הסקה מותאמים אישית עוברים מניסוי נישתי לאתגר משמעותי לדומיננטיות החומרתית של Nvidia.