המודל החדש Kimi K3 של Moonshot AI עקף את GPT-5.6 במבחן הביצועים AA-Briefcase, עם ציון של 1,527 לעומת 1,495 של האחרון. הניצחון מגיע לצד מודל תמחור שהופך את המודל בעל המשקלים הפתוחים (open-weight) עם 2.8 טריליון פרמטרים לאופציה זולה באופן מפתיע למשימות תכנות ארוכות טווח.
למה מבחן הביצועים הזה חשוב
AA-Briefcase מודד ביצועים על עומסי עבודה ממשיים ומתמשכים, ולא על שאלות טריוויה מבודדות. ציון גבוה יותר אומר שמודל יכול לשמור על הקשר (context), לתכנן מראש ולהישאר ממוקד במשימה לאורך אלפי טוקנים – בדיוק התנאים שבהם מתמודדים מפתחים בעת בניית עוזרים אישיים, מחוללי קוד או כלי עזר למחקר. היתרון של Kimi K3 על פני GPT-5.6 מראה שמודל פתוח יכול כעת להתחרות במקומות שבהם המתחרים הסגורים שלטו באופן מסורתי.
התמונה הטכנית
- גודל – 2.8 טריליון פרמטרים, מודל ה-open-weight הגדול ביותר ששוחרר עד כה.
- ארכיטקטורה – Stable LatentMoE (Mixture-of-Experts) עם 896 מומחים, מתוכם 16 פעילים בכל רגע נתון.
- חלון הקשר (Context window) – מעל מיליון טוקנים, מספיק כדי להכיל ספרים שלמים או מאגרי קוד (codebases) ארוכים.
- קשב (Attention) – Kimi Delta Attention, התאמה מותאמת אישית שנטען כי משפרת את יעילות ההתרחבות (scaling efficiency).
בחירות אלו מעניקות למודל את היכולת להתמודד עם משימות "ארוכות טווח" (long-horizon), אך הן גם מעלות את דרישות המחשוב, דבר שבא לידי ביטוי בנתוני המהירות והעלות.
תמחור שמושך את העין
Moonshot מחלקת את תמחור הטוקנים לשלושה סוגים:
| סוג שימוש | עלות לכל 1 מיליון טוקנים |
|---|---|
| קלט – cache miss | $3.00 |
| קלט – cache hit | $0.30 |
| פלט | $15.00 |
החברה טוענת שעומסי עבודה של תכנות מגיעים לשיעור cache-hit של 90%. אם זה נכון, זוהי אופציה זולה מאוד עבור סוכני תכנות (coding agents).
הפשרות שתחושו
- מהירות – המודל מעבד כ-62 טוקנים בשנייה, מתחת לחציון בתחום. פרומפט ארוך עלול להימשך דקות ארוכות, דבר שמשמעותי עבור שימוש אינטראקטיבי.
- עלות הסקה (Reasoning cost) – Kimi K3 פועל עם "מאמץ הסקה מקסימלי" (max reasoning effort) כברירת מחדל ואינו מציע אפשרות להפחית זאת. לכן, שאילתות פשוטות צורכות את אותו תקציב טוקנים כמו שאילתות מורכבות, מה שמנפח את העלויות עבור משימות שגרתיות.
- שימוש בטוקנים נסתרים – חלק מהמשתמשים מדווחים על system prompt משמעותי שהמודל מזריק באופן אוטומטי, מה שמוסיף טוקנים שחויבו אך אינם נראים בבקשת המשתמש.
גורמים אלו משמעותם שהמחיר הנמוך שמוצג בכותרות עלול להתבטל על ידי זמן תגובה איטי יותר וצריכת טוקנים גבוהה יותר בפועל.
זמינות והדרך קדימה
ה-API זמין כבר היום, מה שמאפשר למפתחים להתנסות באופן מיידי. משקלי המודל עצמם ישוחררו ב-27 ביולי, ולאחר מכן אירוח עצמי (self-hosting) יהיה אפשרי. עד אז, על המשתמשים להסתמך על השירות המארח של Moonshot ולקבל את השיהוי (latency) ומבנה התמחור הנלווים לכך.
נקודת מבט נגדית ממחנה המודלים הסגורים
השורה התחתונה שעולה מהדברים
השורה התחתונה העיקרית היא הפער ההולך וקטן בין מודלים סגורים למודלים פתוחים. Kimi K3 מוכיח שמודלים בעלי משקלים פתוחים (open-weight) יכולים להתמודד עם משימות מורכבות וארוכות טווח.
