Microsoft wprowadził MAI Code 1.1 Flash jako model programistyczny nowej generacji dla GitHub Copilot, jednak wczesne benchmarki i tabele cenowe stawiają go za ofertą open-weight od DeepSeek zarówno pod względem wydajności, jak i kosztów.

Rzeczywistość benchmarków kontra komunikat prasowy

Notatki z premiery Microsoftu obiecują 25-procentowy skok wydajności tokenów i 75-procentową redukcję kosztów w porównaniu z czerwcową wersją modelu MAI. Firma chwali się również 4-procentowym wzrostem wskaźnika „code survival” po przeszkoleniu modelu w setkach tysięcy środowisk uczenia ze wzmocnieniem (reinforcement learning) wewnątrz Copilota.

Niezależne testy mówią co innego. W zestawie SWE-bench Verified model MAI Code 1.1 Flash odnotowuje 72,6% skuteczności (pass rate), wyprzedzając minimalnie Claude Haiku 4.5 (69,8%) oraz GPT-5.4 mini (69,2%). Przewaga jest skromna i ograniczona do jednego parametru.

Luka powiększa się w Terminal Bench 2.1, który mierzy zdolność modelu do wykonywania rzeczywistych zadań w wierszu poleceń. Tutaj MAI Code 1.1 Flash uzyskuje wynik 62,9%, podczas gdy DeepSeek-V4-Flash-0731 osiąga 82,7%. Różnica ta jest na tyle duża, że może wpłynąć na programistów polegających na generowaniu kodu skoncentrowanym na terminalu.

Punkty zapalne w cenniku

Microsoft promuje nowy model jako opcję „przyjazną dla budżetu”, ale ceny tokenów mówią co innego. DeepSeek-V4-Flash pobiera 0,14 USD za token wejściowy i 0,28 USD za token wyjściowy. MAI Code 1.1 Flash kosztuje 0,20 USD za wejście i 1,20 USD za wyjście. Claude Haiku 4.5 plasuje się odpowiednio na poziomie 1,00 USD i 5,00 USD, co potwierdza jego status premium.

Gwałtowny wzrost kosztu tokenów wyjściowych oznacza, że w każdym procesie generującym duże bloki kodu model Microsoftu stanie się droższą opcją, nawet po obiecanych redukcjach względem poprzednika. Dla programistów pracujących na dużą skalę oraz przedsiębiorstw rachunek ekonomiczny wyraźnie przemawia za DeepSeek.

Jak powstał MAI Code 1.1 Flash

Model ten jest częścią szerszych działań Microsoftu mających na celu zastąpienie usług zewnętrznych w stosie Copilot alternatywami budowanymi wewnętrznie. Dzięki trenowaniu na obszernych danych z uczenia ze wzmocnieniem, pochodzących z użytkowania Copilota, Microsoft ma nadzieję na zacieśnienie pętli zwrotnej między zachowaniem użytkownika a ulepszaniem modelu. Premiera ta wpisuje się również w schemat stopniowych ulepszeń: czerwcowa wersja była pozycjonowana jako oszczędność kosztów, a iteracja Flash jest przedstawiana jako kolejny krok w tej trajektorii.

Zwycięzcy, przegrani i szersza stawka

Przedsiębiorstwa dążące do kontrolowania wydatków na AI mogą uznać cennik DeepSeek za bardziej atrakcyjny, zwłaszcza przy dużej objętości generowanych danych. Microsoft z kolei zyskuje ściślejszą kontrolę nad ekosystemem Copilot oraz możliwość przekierowania przychodów z dala od zewnętrznych dostawców, takich jak OpenAI czy Anthropic.

Możliwa linia obrony Microsoftu

Własne dane Microsoftu kładą nacisk na zyski w wydajności tokenów oraz niewielką przewagę w SWE-bench.

Na co warto zwrócić uwagę w przyszłości

  • Wskaźniki adopcji: Statystyki użytkowania Copilota ujawnią, czy programiści przejdą na nowy model domyślny, czy będą importować alternatywne modele za pomocą API.
  • Korekty cenowe: Jeśli cena tokenów wyjściowych Microsoftu pozostanie wysoka, presja rynkowa może wymusić rewizję.
  • Aktualizacje benchmarków: Nowe wersje testów skoncentrowanych na terminalu mogą zmienić układ sił w wydajności, zwłaszcza gdy Microsoft będzie udoskonalać swój proces uczenia ze wzmocnieniem.
  • Konkurencja modeli open-weight: Pojawienie się kolejnych modeli open-weight w przestrzeni programistycznej może zaostrzyć wyścig o stosunek ceny do wydajności.

Podsumowanie

MAI Code 1.1 Flash przynosi skromne zyski w wąskim zakresie benchmarków, ale ustępuje modelowi open-weight od DeepSeek zarówno pod względem wydajności w terminalu, jak i kosztów tokenów, co zmusza programistów do wyboru między wygodą integracji a czystą wydajnością.