Нова модель Xiaomi MiMo-V2-Flash — система з сумішшю експертів (MoE) на 309 мільярдів параметрів — тепер очолює відкритий лідерборд SWE-Bench із точністю 73,4 %, використовуючи при цьому менше ніж 1/50 обчислювальних ресурсів порівнянних моделей. Цей результат демонструє, що елітна продуктивність можлива без величезних витрат на електроенергію, які стали нормою для досліджень великих мовних моделей.
Чому Xiaomi обрала MoE
Архітектура MoE дозволяє уникнути високих витрат завдяки приєднанню багатьох підмереж «експертів» до спільної основи (backbone). Модель зберігає всі 309 млрд параметрів, але для кожного токена активує лише близько 15 млрд. Така вибірково активація різко скорочує обсяг пам'яті та обчислень під час інференсу, дозволяючи моделі працювати приблизно на десяти GPU H100 із 618 ГБ відеопам'яті (VRAM) у режимі FP16.
Інженерні хитрощі, що роблять її практичною
- Гібридний патерн уваги — Більшість шарів використовують механізм уваги з ковзним вікном (sliding-window attention), що обмежує матрицю уваги вузькою смугою навколо кожного токена. Кожен шостий шар перемикається на глобальну увагу, фіксуючи довгострокові залежності без надмірного споживання пам'яті. Такий підхід скорочує використання пам'яті в шість разів.
- Модуль швидкого декодування — Вбудований предиктор видає кілька токенів за один прямий прохід (forward pass), забезпечуючи швидкість генерації до 2,6 раза вищу, ніж стандартне авторегресійне декодування.
- Контекстне вікно 256 K — Архітектура обробляє вхідні дані обсягом у чверть мільйона токенів, що корисно для баз коду, наукових праць або будь-яких довгих документів.
Ці компоненти дозволяють використовувати модель на обладнанні, яке інакше було б недоступним для системи масштабу 309 млрд параметрів.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD навчає модель-студента — MiMo-V2-Flash — за допомогою багатьох спеціалізованих «вчительів»: один для математики, інший для програмування тощо. Поки студент генерує власні відповіді, він одночасно отримує зворотний зв'язок від усіх учителів. Оскільки студент навчається на основі розподілу, який він фактично створюватиме, дистиляція залишається стабільною, а передача знань зосереджена на реальних завданнях.
MOPD споживає менше ніж 1/50 обчислювальних ресурсів, необхідних традиційним методам.
Результати бенчмарків
| Бенчмарк | Результат |
|---|---|
| SWE-Bench (програмування) | 73,4 % |
| GPQA-Diamond (загальні питання та відповіді) | 83,7 % |
| MMLU-Pro (багатозадачне розуміння мови) | 84,9 % |
| Arena-Hard (змагальний чат) | 86,2 % |
Залишаються певні компроміси
Навіть з урахуванням економії завдяки MoE, запуск MiMo-V2-Flash — це не те, що можна зробити на ноутбуці. Для розгортання все ще потрібно приблизно десять GPU H100, а вимога до 618 ГБ відеопам'яті обмежує використання моделі середовищами дата-центрів із високошвидкісними інтерконектами.
За чим стежити далі
Висновок: MiMo-V2-Flash доводить, що розумні конвеєри навчання та модульні архітектури можуть забезпечити топову продуктивність без неконтрольованих витрат на обчислення, які роками визначали розвиток великих мовних моделей. Наступним викликом є те, щоб зробити таку продуктивність достатньо доступною для всіх, а не лише для добре фінансованих лабораторій.
