שבב ה-inference החדש של OpenAI, ה-Jalapeño, עקף את ה-Blackwell של Nvidia במבחן הביצועים InferenceX, כשהוא מספק פי 1.5 עד 1.9 יותר עבודת AI לכל וואט ושיהוי (latency) נמוך משמעותית. התוצאה חשובה מכיוון שהיא עשויה לצמצם את עלויות התפעול של שירותי מודלי שפה בקנה מידה גדול ולהפעיל לחץ על הדומיננטיות של Nvidia בתחום מאיצי ה-AI.
למה השבב הזה חשוב
OpenAI חשפה את ה-Jalapeño בכנס Hot Chips 2026 והדגישה שיתוף פעולה עם Broadcom בתכנון הסיליקון. המתכננים התמקדו בחוסר היעילות הגדול ביותר בצינורות ה-inference הנוכחיים: תנועת נתונים במהלך שלב ה-prefill ותקשורת בין יחידות חישוב. על ידי שמירה על ה-KV cache (key-value) מקומי, ה-Jalapeño מצמצם את הזמן המושקע בהזזת טנזורים (tensors), מה שמאיץ את יצירת ה-tokens וחוסך באנרגיה.
מספרים בולטים
- עבודת AI לכל וואט: פי 1.5 עד 1.9 יותר בשיא התפוקה (throughput) בהשוואה ל-Blackwell.
- Latency (שיהוי): נמוך פי 1.7 עד 3.6, כך שהתגובות מגיעות מהר יותר למשתמשים אינטראקטיביים.
- ביצועי עומסי עבודה אינטראקטיביים: פי 2.1 עד 4.1 גבוהים יותר, רווח המשפיע ישירות על אפליקציות בסגנון צ'אט.
השיפורים הללו מופיעים במבחן ה-InferenceX, שם ה-Jalapeño ניצח גם את שבבי ה-Rubin הקרובים של Nvidia.
השפעה עסקית
OpenAI כבר משתמשת בשיפורי היעילות כדי להוזיל מחירים ב-GPT-5.6 Sol API שלה, ומציעה הנחות של 20% עד 33% לעומת התעריפים הקודמים. צריכת חשמל נמוכה יותר מקטינה את עלות ההפעלה של אשכולות (clusters) inference מאסיביים, חיסכון שמפתחים וארגונים יוכלו להרגיש.
תזמון ולחץ תחרותי
ה-Jalapeño יישלח בכמויות מוגבלות עד סוף 2026, כאשר ייצור המוני מתוכנן לשנת 2027. עד אז, Nvidia מצפה להוציא דורות חדשים יותר של GPU, מה שעשוי לצמצם את הפער. ההשקה המדורגת מחייבת את OpenAI להוכיח יתרונות בעולם האמיתי לפני שהמתחרים ישחררו סיליקון חדש.
נקודת מבט נגדית
סביר להניח של-Nvidia יהיו שבבים חדשים יותר בשוק עד אז.
מה כדאי לעקוב אחריו
- נתוני פריסה (Deployment): משוב מוקדם מלקוחות על שיהוי וחיסכון בחשמל יראה אם מספרי המבחנים נשמרים גם בסביבת ייצור (production).
- אסטרטגיית תמחור: המשך הורדת מחירי ה-API עלול לדחוף ספקים אחרים לעבר חומרה דומה או להוביל לאובדן נתח שוק.
- מפת הדרכים (Roadmap) של Nvidia: כל הודעה על מאיץ חדש הממוקד ב-inference תעצב מחדש את הדינמיקה התחרותית.
הגישה ה-full-stack של OpenAI — בניית מודלים, שבבים וזיכרון יחד — מעניקה לה יתרון שחסר למאיצים סטנדרטיים. השאלה האם היתרון הזה יהפוך לשינוי שוק מתמשך תלויה בשאלה כמה מהר שבב ה-Jalapeño יעבור משלב האב-טיפוס לשימוש נרחב, וכיצד Nvidia תענה לאתגר היעילות.
