Microsoft випустила MAI Code 1.1 Flash як модель кодування наступного покоління для GitHub Copilot, проте перші бенчмарки та таблиці цін ставлять її позаду пропозиції DeepSeek з відкритими вагами як за продуктивністю, так і за вартістю.

Реальність бенчмарків проти пресрелізу

У нотатках до запуску Microsoft обіцяє 25% стрибок ефективності токенів та 75% скорочення витрат порівняно з червневою версією її моделі MAI. Компанія також заявляє про 4% зростання показника «code survival» після навчання моделі в сотнях тисяч середовищ навчання з підкріпленням усередині Copilot.

Незалежне тестування свідчить про інше. У наборі тестів SWE-bench Verified MAI Code 1.1 Flash демонструє рівень успішного виконання 72,6%, трохи випереджаючи Claude Haiku 4.5 (69,8%) та GPT-5.4 mini (69,2%). Ця перевага є незначною і обмеженою лише одним показником.

Розрив збільшується на Terminal Bench 2.1, який вимірює здатність моделі виконувати реальні завдання в командному рядку. Тут MAI Code 1.1 Flash набирає 62,9%, тоді як DeepSeek-V4-Flash-0731 показує результат 82,7%. Ця різниця є достатньо великою, щоб вплинути на розробників, які покладаються на генерацію коду через термінал.

Точки цінового тиску

Microsoft позиціонує нову модель як «бюджетний» варіант, але ціни на токени свідчать про ін