Nowy model Microsoft MAI-Cyber-1-Flash uzyskał wynik 96% w benchmarku CyberGym, wyprzedzając porównywalne modele bezpieczeństwa od Anthropic, Google i OpenAI. Microsoft twierdzi, że to podejście może obniżyć koszty korporacyjnych silników bezpieczeństwa o około połowę, wciąż wykrywając większość błędów na poziomie kodu.

Jak działa ten model

MAI-Cyber-1-Flash to kompaktowy model o wysokiej przepustowości, który samodzielnie obsługuje około 90% rutynowych zadań związanych z bezpieczeństwem. Microsoft przekierowuje pozostałe, trudniejsze przypadki do większego i droższego modelu — GPT-5.4 od OpenAI — za pomocą systemu „inteligentnego routingu” (smart routing) lub kaskadowania modeli. Tani model wykonuje większość pracy; droższy model jest wywoływany tylko w przypadku nietypowych wyzwań (edge cases). Microsoft twierdzi, że ten podział redukuje całkowite wydatki o 50%.

Dlaczego wynik CyberGym ma znaczenie

CyberGym mierzy zdolność modelu do wykrywania luk w bezpieczeństwie w kodzie źródłowym. Wynik na poziomie 96% oznacza, że model poprawnie identyfikuje prawie wszystkie wstrzyknięte błędy w zestawie testowym. Microsoft pozycjonuje tę dokładność, w połączeniu z oszczędnym kosztowo routingiem, jako nowy standard dla wielkoskalowych procesów (pipelines) bezpieczeństwa kodu.

Stawka dla przedsiębiorstw

Microsoft przetwarza około 100 bilionów sygnałów bezpieczeństwa każdego dnia. Poprzez orkiestrację mieszanki wyspecjalizowanych modeli, firma dąży do pełnienia roli centralnego „orkiestratora bezpieczeństwa” dla swoich klientów Azure, oferując pojedynczą usługę, która może skalować się bez gwałtownego wzrostu budżetów. Jeśli twierdzenie o redukcji kosztów się potwierdzi, organizacje mogłyby przesunąć znaczną część wydatków na bezpieczeństwo na poszukiwanie zagrożeń (threat hunting) lub raportowanie zgodności (compliance).

Argumenty przeciw, które należy wziąć pod uwagę

Krytycy ostrzegają, że wyniki benchmarków nie zawsze przekładają się na środowiska rzeczywiste, w których bazy kodu, języki i wektory zagrożeń znacznie się różnią. Poleganie na zewnętrznym modelu (GPT-5.4) w najtrudniejszych przypadkach budzi również obawy dotyczące rezydencji danych, opóźnień (latency) oraz uzależnienia od dostawcy (vendor lock-in). Co więcej, liczba 50% oszczędności zakłada rozkład obciążenia odpowiadający wewnętrznemu ruchowi Microsoftu; w niektórych firmach wpływ ten może być mniejszy.

Na co zwrócić uwagę w przyszłości

Microsoft wdraża model poprzez usługi bezpieczeństwa Azure, więc wskaźniki adopcji wśród klientów korporacyjnych będą pierwszym konkretnym testem. Obserwatorzy będą również śledzić rozszerzenie podejścia kaskadowego na sektory regulowane, takie jak ochrona zdrowia i finanse, gdzie przepisy dotyczące prywatności danych mogą skomplikować korzystanie z modeli zewnętrznych dostawców.

Podsumowanie: MAI-Cyber-1-Flash pokazuje, że strategia hybrydowa może zapewnić wykrywanie na poziomie zbliżonym do najwyższego, obiecując jednocześnie znaczną redukcję kosztów — pod warunkiem, że wydajność utrzyma się poza laboratorium, a narzut związany z routingiem pozostanie niski.