המודל החדש של Xiaomi, MiMo-V2-Flash, מערכת mixture-of-experts (MoE) בעלת 309 מיליארד פרמטרים, כעת בראש לוח התוצאות (leaderboard) של הקוד הפתוח ב-SWE-Bench עם דיוק של 73.4%, תוך שימוש בפחות מ-1/50 מכוח המחשוב (compute) של מודלים דומים. התוצאה מראה שביצועים ברמה עילאית הם אפשריים ללא חשבונות האנרגיה העצומים שהפכו לנורמה במחקר של מודלי שפה גדולים (LLMs).
מדוע Xiaomi פנתה ל-MoE
ארכיטקטורת MoE עוקפת את העלות על ידי חיבור תתי-רשתות רבות של "מומחים" (experts) לעמוד שדרה (backbone) משותף. המודל מאחסן את כל 309 מיליארד הפרמטרים, אך מפעיל רק כ-15 מיליארד עבור כל טוקן (token). הפעלה סלקטיבית זו מקצצת משמעותית את זיכרון ההסקה (inference) וכוח המחשוב, מה שמאפשר למודל לרוץ על כעשרה מעבדי גרפיים מסוג H100 עם 618 GB של VRAM במצב FP16.
הטריקים ההנדסיים שהופכים אותו לפרקטי
- דפוס קשב היברידי (Hybrid attention pattern) – רוב השכבות משתמשות ב-sliding-window attention, המגביל את מטריצת הקשב לרצועה צרה סביב כל טוקן. כל שכבה שישית עוברת ל-global attention, מה שמאפשר ללכוד תלות ארוכת טווח מבלי לנפח את צריכת הזיכרון. הדפוס הזה מקצץ את השימוש בזיכרון פי שש.
- מודול פענוח מהיר (Fast decoding module) – מנבא (predictor) מובנה פולט מספר טוקנים במעבר קדימה (forward pass) יחיד, מה שמספק מהירות יצירה הגבוהה פי 2.6 מפענוח אוטורגרסיבי (autoregressive decoding) סטנדרטי.
- חלון הקשר (context window) של 256K – הארכיטקטורה קולטת קלטים של רבע מיליון טוקנים, דבר שימושי עבור מאגרי קוד (codebases), מאמרים מחקריים או כל מסמך ארוך אחר.
רכיבים אלו שומרים על המודל כניתן לשימוש על חומרה שבמצב אחר הייתה חורגת מהיכולת של מערכת בקנה מידה של 309B.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD מאמן את מודל הסטודנט — MiMo-V2-Flash — באמצעות מורים מומחים רבים: אחד למתמטיקה, אחר לתכנות, וכן הלאה. בעוד הסטודנט מייצר תגובות משלו, הוא מקבל משוב מכל המורים בבת אחת. מכיוון שהסטודנט לומד מהתפלגות (distribution) שהוא עצמו ייצר, תהליך הזיקוק (distillation) נשאר יציב והעברת הידע נשארת ממוקדת במשימות מהעולם האמיתי.
MOPD צורך פחות מ-1/50 מכוח המחשוב הנדרש בשיטות מסורתיות.
ביצועי בנצ'מרק
| בנצ'מרק | ציון |
|---|---|
| SWE-Bench (coding) | 73.4% |
| GPQA-Diamond (general QA) | 83.7% |
| MMLU-Pro (multitask language understanding) | 84.9% |
| Arena-Hard (adversarial chat) | 86.2% |
הפשרות שנותרו
גם עם החיסכון ש-MoE מספק, הרצת MiMo-V2-Flash אינה משימה שניתן לבצע על מחשב נייד. פריסות (deployments) עדיין דורשות כעשרה מעבדי H100, ודרישת ה-618 GB של VRAM מגבילה את המודל לסביבות של מרכזי נתונים (data-centers) עם קישורי רשת מהירים (high-speed interconnects).
מה כדאי לעקוב אחריו בהמשך
שורה תחתונה: MiMo-V2-Flash מוכיח שצינורות אימון (training pipelines) חכמים וארכיטקטורות מודולריות יכולים לספק ביצועים מהשורה הראשונה ללא עלויות המחשוב המופרזות שהגדירו את פיתוח מודלי השפה הגדולים במשך שנים. המכשול הבא הוא להפוך את הביצועים הללו לנגישים וזולים מספיק עבור כל אחד, מעבר למעבדות בעלות מימון גבוה.
