Microsoft выпустила MAI Code 1.1 Flash — модель кодинга следующего поколения для GitHub Copilot, однако первые бенчмарки и таблицы цен ставят её позади решения с открытыми весами от DeepSeek как по производительности, так и по стоимости.
Реальность бенчмарков против пресс-релиза
В анонсе Microsoft обещается 25-процентный скачок эффективности использования токенов и снижение стоимости на 75% по сравнению с июньской версией модели MAI. Компания также заявляет о 4-процентном росте показателя «выживаемости кода» (code survival) после обучения модели в сотнях тысяч сред обучения с подкреплением внутри Copilot.
Независимое тестирование рисует иную картину. В наборе тестов SWE-bench Verified модель MAI Code 1.1 Flash демонстрирует 72,6% успешных прохождений, лишь слегка опережая Claude Haiku 4.5 (69,8%) и GPT-5.4 mini (69,2%). Это преимущество незначительно и ограничивается лишь одним показателем.
Разрыв увеличивается в Terminal Bench 2.1, который измеряет способность модели выполнять реальные задачи в командной строке. Здесь MAI Code 1.1 Flash набирает 62,9%, в то время как DeepSeek-V4-Flash-0731 показывает результат 82,7%. Эта разница достаточно велика, чтобы повлиять на разработчиков, чей рабочий процесс завязан на генерации кода через терминал.
Точки ценового давления
Microsoft позиционирует новую модель как «бюджетный» вариант, но цены за токены говорят об обратном. DeepSeek-V4-Flash берет $0,14 за входной токен и $0,28 за выходной. MAI Code 1.1 Flash стоит $0,20 за входной и $1,20 за выходной. Claude Haiku 4.5 стоит $1,00 и $5,00 соответственно, что подтверждает её премиальный статус.
Резкий скачок стоимости выходных токенов означает, что любой рабочий процесс, генерирующий большие блоки кода, сделает модель Microsoft более дорогим выбором, даже с учетом обещанного снижения цен по сравнению с предшественницей. Для высокомасштабируемых разработчиков и предприятий экономическая выгода явно склоняется в сторону DeepSeek.
Как появился MAI Code 1.1 Flash
Модель является частью более масштабной стратегии Microsoft по замене сторонних сервисов в стеке Copilot собственными разработками. Обучая модель на обширных данных обучения с подкреплением, полученных из использования Copilot, Microsoft надеется сократить цикл обратной связи между поведением пользователя и улучшением модели. Запуск также следует тенденции постепенных обновлений: июньская версия позиционировалась как средство экономии средств, а итерация Flash представлена как следующий шаг в этой траектории.
Победители, проигравшие и общие ставки
Предприятия, стремящиеся контролировать расходы на ИИ, могут найти ценовую политику DeepSeek более привлекательной, особенно при больших объемах генерации. Microsoft, тем временем, получает более жесткий контроль над экосистемой Copilot и возможность перенаправить выручку от внешних провайдеров, таких как OpenAI или Anthropic.
Возможная защита Microsoft
Собственные данные Microsoft делают акцент на повышении эффективности токенов и незначительном преимуществе в SWE-bench.
На что обратить внимание в дальнейшем
- Показатели внедрения: статистика использования Copilot покажет, перейдут ли разработчики на новый стандарт по умолчанию или будут импортировать альтернативные модели через API.
- Корректировка цен: если цена на выходные токены Microsoft останется высокой, рыночное давление может вынудить компанию пересмотреть политику.
- Обновления бенчмарков: новые версии тестов, ориентированных на работу в терминале, могут изменить баланс производительности, особенно по мере совершенствования Microsoft своего конвейера обучения с подкреплением.
- Конкуренция моделей с открытыми весами: появление дополнительных моделей с открытыми весами в сфере кодинга может усилить гонку «цена-производительность».
Итог
MAI Code 1.1 Flash обеспечивает скромные улучшения в узком бенчмарке, но уступает модели с открытыми весами от DeepSeek как в производительности в терминале, так и в стоимости токенов, заставляя разработчиков выбирать между удобством интеграции и чистой эффективностью.
