Новая модель Xiaomi MiMo-V2-Flash — система на базе архитектуры Mixture-of-Experts (MoE) с 309 миллиардами параметров — теперь возглавляет открытый лидерборд SWE-Bench с точностью 73,4 %, используя при этом менее 1/50 вычислительных мощностей по сравнению с аналогичными моделями. Этот результат доказывает, что достичь элитной производительности можно без колоссальных затрат на электроэнергию, ставших нормой в исследованиях больших языковых моделей.
Почему Xiaomi выбрала MoE
Архитектура MoE позволяет снизить затраты за счет подключения множества специализированных подсетей («экспертов») к общей базовой структуре (backbone). Модель хранит все 309 млрд параметров, но для каждого токена активирует лишь около 15 млрд. Такая селективная активация резко сокращает объем памяти и вычислительных ресурсов, необходимых для инференса, позволяя запускать модель примерно на десяти GPU H100 с 618 ГБ видеопамяти (VRAM) в режиме FP16.
Инженерные хитрости, обеспечивающие практичность
- Гибридный паттерн внимания — в большинстве слоев используется механизм sliding-window attention (внимание со скользящим окном), что ограничивает матрицу внимания узкой полосой вокруг каждого токена. Каждый шестой слой переключается на глобальное внимание (global attention), улавливая дальние зависимости без чрезмерного потребления памяти. Такой подход снижает использование памяти в шесть раз.
- Модуль быстрого декодирования — встроенный предиктор выдает несколько токенов за один прямой проход (forward pass), обеспечивая скорость генерации до 2,6 раза выше, чем при стандартном авторегрессионном декодировании.
- Контекстное окно в 256 K токенов — архитектура способна обрабатывать входные данные объемом в четверть миллиона токенов, что полезно для кодовых баз, научных работ или любых длинных документов.
Эти компоненты позволяют использовать модель на оборудовании, которое иначе было бы недоступно для системы масштаба 309 млрд параметров.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD обучает модель-студента — MiMo-V2-Flash — с использованием множества специализированных моделей-учителей: одна для математики, другая для программирования и так далее. Пока студент генерирует собственные ответы, он одновременно получает обратную связь от всех учителей. Поскольку студент обучается на распределении, которое он будет генерировать на самом деле, дистилляция остается стабильной, а передача знаний фокусируется на реальных задачах.
MOPD потребляет менее 1/50 вычислительных ресурсов, требуемых традиционными методами.
Результаты бенчмарков
| Бенчмарк | Результат |
|---|---|
| SWE-Bench (программирование) | 73,4 % |
| GPQA-Diamond (общие вопросы и ответы) | 83,7 % |
| MMLU-Pro (многозадачное понимание языка) | 84,9 % |
| Arena-Hard (состязательный чат) | 86,2 % |
Остающиеся компромиссы
Даже с учетом экономии за счет MoE, запуск MiMo-V2-Flash — это не задача для ноутбука. Для развертывания по-прежнему требуется около десяти GPU H100, а требование к 618 ГБ видеопамяти ограничивает использование модели средами дата-центров с высокоскоростными интерконнектами.
За чем следить дальше
Итог: MiMo-V2-Flash доказывает, что продуманные конвейеры обучения и модульные архитектуры могут обеспечить первоклассную производительность без бесконтрольного роста вычислительных затрат, который определял развитие больших языковых моделей на протяжении многих лет. Следующее препятствие — сделать такую производительность достаточно доступной для всех, а не только для лабораторий с огромным финансированием.
