Il nuovo modello MAI-Cyber-1-Flash di Microsoft ha ottenuto un punteggio del 96% nel benchmark CyberGym, superando modelli di sicurezza comparabili di Anthropic, Google e OpenAI. Microsoft afferma che questo approccio può ridurre i costi dei motori di sicurezza aziendali di circa la metà, riuscendo comunque a individuare la maggior parte delle falle a livello di codice.

Come funziona il modello

MAI-Cyber-1-Flash è un modello compatto ad alto throughput che gestisce autonomamente circa il 90% dei compiti di sicurezza di routine. Microsoft indirizza i casi rimanenti, più complessi, verso un modello più grande e costoso — GPT-5.4 di OpenAI — attraverso un sistema di "smart routing" o di "model-cascading". Il modello economico svolge la maggior parte del lavoro; il modello costoso viene invocato solo per le sfide legate ai casi limite. Microsoft sostiene che questa suddivisione riduca la spesa complessiva del 50%.

Perché il punteggio CyberGym è importante

CyberGym misura la capacità di un modello di individuare vulnerabilità di sicurezza nel codice sorgente. Un tasso di successo del 96% significa che il modello identifica correttamente quasi tutte le falle iniettate nella suite di test. Microsoft sta posizionando tale precisione, combinata con il routing che permette il risparmio sui costi, come un nuovo standard per le pipeline di sicurezza del codice su larga scala.

Il valore per le imprese

Microsoft elabora circa 100 trilioni di segnali di sicurezza ogni giorno. Orchestrando un mix di modelli specializzati, l'azienda mira ad agire come un "orchestratore di sicurezza" centrale per i suoi clienti Azure, offrendo un servizio unico in grado di scalare senza far esplodere i budget. Se la dichiarazione sul taglio dei costi dovesse rivelarsi corretta, le organizzazioni potrebbero spostare una parte considerevole della loro spesa per la sicurezza verso il threat-hunting o la reportistica di conformità.

Controargomentazioni da considerare

I critici avvertono che i risultati dei benchmark non sempre si traducono in ambienti reali, dove codebase, linguaggi e vettori di minaccia variano ampiamente. Affidarsi a un modello esterno (GPT-5.4) per i casi più difficili solleva inoltre preoccupazioni relative alla residenza dei dati, alla latenza e al vendor lock-in. Inoltre, la cifra del risparmio del 50% presuppone una distribuzione del carico di lavoro che corrisponda al traffico interno di Microsoft; alcune aziende potrebbero riscontrare un impatto minore.

Cosa osservare in futuro

Microsoft sta distribuendo il modello attraverso i servizi di sicurezza di Azure, quindi i tassi di adozione tra i clienti aziendali saranno il primo test concreto. Gli osservatori monitoreranno anche l'estensione dell'approccio a cascata verso settori regolamentati come l'assistenza sanitaria e la finanza, dove le norme sulla privacy dei dati potrebbero complicare l'uso di modelli di terze parti.

In sintesi: MAI-Cyber-1-Flash dimostra che una strategia basata su modelli ibridi può offrire un rilevamento quasi ai massimi livelli, promettendo al contempo riduzioni significative dei costi, a condizione che le prestazioni si mantengano costanti al di fuori del laboratorio e che l'overhead del routing rimanga basso.