Microsoft השיקה את MAI Code 1.1 Flash כמודל קידוד מהדור הבא עבור GitHub Copilot, אך מדדי ביצועים (benchmarks) מוקדמים וטבלאות תמחור מציבים אותו מאחורי ההצעה בקוד פתוח (open-weight) של DeepSeek הן בביצועים והן בעלות.
מציאות המדדים מול ההודעה לעיתונות
הערות ההשקה של Microsoft מבטיחות קפיצה של 25% ביעילות טוקנים (token efficiency) וקיצוץ של 75% בעלות בהשוואה לגרסת יוני של מודל ה-MAI שלה. החברה גם מצהירה על עלייה של 4% ב-"code survival" לאחר אימון המודל במאות אלפי סביבות למידת חיזוק (reinforcement-learning) בתוך Copilot.
בדיקות עצמאיות מספרות סיפור אחר. במערך SWE-bench Verified, MAI Code 1.1 Flash רושם שיעור מעבר של 72.6%, במעט מעל Claude Haiku 4.5 (69.8%) ו-GPT-5.4 mini (69.2%). היתרון הוא צנוע ומוגבל למדד בודד.
הפער מתרחב ב-Terminal Bench 2.1, המודד את יכולתו של מודל להשלים משימות שורת פקודה (command-line) בעולם האמיתי. כאן MAI Code 1.1 Flash מקבל ציון של 62.9%, בעוד ש-DeepSeek-V4-Flash-0731 מציג תוצאה של 82.7%. ההפרש הזה גדול מספיק כדי להשפיע על מפתחים הנשענים על יצירת קוד מבוססת טרמינל.
נקודות לחץ בתמחור
Microsoft משווקת את המודל החדש כאופציה "ידידותית לתקציב", אך תמחור הטוקנים אומר אחרת. DeepSeek-V4-Flash גובה $0.14 לכל טוקן קלט (input) ו-$0.28 לכל טוקן פלט (output). MAI Code 1.1 Flash מציע $0.20 לקלט ו-$1.20 לפלט. Claude Haiku 4.5 עומד על $1.00 ו-$5.00 בהתאמה, מה שמאשר את מעמדו כפרימיום.
הקפיצה התלולה בעלות טוקן הפלט משמעותה שכל תהליך עבודה (workflow) המייצר בלוקים גדולים של קוד יראה את המודל של Microsoft כבחירה היקרה יותר, גם לאחר ההפחתות המובטחות לעומת קודמו. עבור מפתחים וארגונים בעלי קנה מידה גדול, הכלכלה נוטה בחדות לכיוון DeepSeek.
כיצד הגיע MAI Code 1.1 Flash
המודל הוא חלק מהדחיפה הרחבה יותר של Microsoft להחליף שירותי צד שלישי במערך ה-Copilot בחלופות שנבנו פנימית. באמצעות אימון על נתוני למידת חיזוק (reinforcement-learning) נרחבים שנלקחו משימוש ב-Copilot, Microsoft מקווה לצמצם את לולאת המשוב בין התנהגות המשתמש לשיפור המודל. ההשקה גם עוקבת אחר דפוס של שדרוגים הדרגתיים: גרסת יוני הוצגה כחוסכת בעלויות, וגרסת ה-Flash ממוצגת כצעד הבא במסלול זה.
מנצחים, מפסידים וההימורים הרחבים יותר
ארגונים המבקשים לשלוט בהוצאות ה-AI עשויים למצוא את התמחור של DeepSeek אטרקטיבי יותר, במיוחד כאשר נפח הפלט גבוה. Microsoft, לעומת זאת, משיגה שליטה הדוקה יותר על המערכת האקולוגית (ecosystem) של Copilot ואת היכולת להסיט הכנסות מספקים חיצוניים כמו OpenAI או Anthropic.
ההגנה האפשרית של Microsoft
הנתונים של Microsoft עצמה מדגישים את השיפור ביעילות הטוקנים ויתרון צנוע ב-SWE-bench.
מה לעקוב בהמשך
- מדדי אימוץ: סטטיסטיקות השימוש ב-Copilot יחשפו האם מפתחים עוברים לברירת המחדל החדשה או מייבאים מודלים חלופיים באמצעות ה-API.
- התאמות תמחור: אם מחיר טוקן הפלט של Microsoft יישאר גבוה, לחץ שוק עשוי לכפות עדכון.
- עדכוני מדדים: גרסאות חדשות של מבחנים ממוקדי טרמינל עשויות להזיז את מאזן הביצועים, במיוחד ככל ש-Microsoft משכללת את תהליך למידת החיזוק שלה.
- תחרות מודלים בקוד פתוח (open-weight): מודלים נוספים בקוד פתוח הנכנסים לתחום הקידוד עשויים להגביר את המרוץ בין מחיר לביצועים.
שורה תחתונה
MAI Code 1.1 Flash מביא שיפורים צנועים במדד צר, אך אינו משתווה למודל ה-open-weight של DeepSeek הן בביצועי טרמינל והן בעלות הטוקנים, מה שמותיר למפתחים לשקול את נוחות האינטגרציה מול יעילות גולמית.
