Kimi K3 resta indietro rispetto ai modelli frontier statunitensi nelle cyber-esploitazioni: il divario della distillazione
Una valutazione congiunta del British AI Security Institute (UK AISI) e dell'U.S. Center for AI Standards and Innovation (CAISI) ha rivelato un significativo divario di capacità nelle operazioni cyber offensive tra i modelli di IA cinesi e statunitensi. Sebbene il Kimi K3 di Moonshot AI mostri potenziale, rimane sostanzialmente indietro rispetto ai principali modelli frontier americani quando viene incaricato di complesse attività di sfruttamento del software e attacchi di rete.
ExploitBench: Il divario nella ricerca sulle vulnerabilità
Per misurare le capacità di sviluppo di exploit, i ricercatori hanno utilizzato ExploitBench, un benchmark della Carnegie Mellon University che coinvolge 41 vulnerabilità scoperte nel motore V8 di Chrome dopo il 2023. I risultati hanno evidenziato una netta divisione nelle prestazioni. I principali modelli statunitensi hanno raggiunto un punteggio medio del 76,2%, mentre il Kimi K3 ha ottenuto un punteggio significativamente inferiore, pari al 32,2%. Sebbene il Kimi K3 abbia superato il GLM-5.2 cinese (24,4%), non è riuscito a raggiungere il livello più alto di sfruttamento: l'Arbitrary Code Execution (ACE).
Al contrario, i modelli statunitensi di fascia alta hanno ottenuto con successo l'ACE in 20 dei 41 compiti testati, garantendo il pieno controllo sui sistemi bersaglio: un livello di sofisticatezza che il Kimi K3 non è riuscito a replicare.
Simulazione di attacchi di rete tramite "The Last Ones"
La valutazione ha testato inoltre i modelli utilizzando "The Last Ones" (TLO), una simulazione di un complesso attacco alla rete aziendale in 32 fasi che coinvolge 20 host distribuiti su quattro sottoreti. Questo test è progettato per misurare la capacità di un agente di navigare attraverso percorsi di intrusione multi-stadio.
Il Kimi K3 ha raggiunto una media di 17 passaggi su 32, dimostrando una capacità intermedia. Sebbene abbia completato l'intero percorso di attacco in un tentativo su dieci, ha mancato della costanza dei modelli statunitensi, che hanno raggiunto una media di 28,5 passaggi. I risultati suggeriscono che, sebbene il Kimi K3 sia in grado di attaccare autonomamente sistemi aziendali con difese deboli, manca dell'affidabilità dei modelli frontier occidentali per eseguire operazioni sofisticate a catena lunga.
La teoria della distillazione: perché esiste questo divario
Rimane una domanda critica: perché i modelli cinesi restano indietro nelle attività cyber anche quando ottengono buoni risultati nei benchmark generali? Il rapporto suggerisce che ciò possa essere dovuto alla "distillazione", ovvero la pratica di utilizzare output di alta qualità provenienti da modelli frontier (come Claude di Anthropic) come dati di addestramento.
Se Moonshot AI ha utilizzato la distillazione per addestrare Kimi K3, è probabile che abbia trascurato dati critici relativi alle operazioni cyber offensive. I principali modelli statunitensi impiegano rigorosi classificatori di sicurezza che bloccano le query offensive avanzate. Di conseguenza, un dataset costruito a partire dagli output pubblici di questi modelli risulterebbe naturalmente privo proprio di quelle conoscenze necessarie per lo sfruttamento di alto livello. Ciò spiega come il Kimi K3 possa eguagliare i modelli occidentali nella programmazione generale e nel ragionamento, pur fallendo significativamente nelle attività cyber offensive specializzate.
Capacità in crescita e rischi persistenti
Nonostante l'attuale divario, l'analisi delle serie temporali di CAISI mostra che sia i modelli statunitensi che quelli cinesi seguono una traiettoria ascendente basata sul punteggio Elo. Il divario di prestazioni per i modelli open si è ridotto da sei-dieci mesi all'inizio del 2025 a soli quattro-sette mesi recentemente. L'UK AISI avverte che questo restringimento del divario non equivale a maggiore sicurezza; la crescente capacità dei modelli open-weight rappresenta un "rischio persistente e irreversibile di uso improprio" nel panorama globale della cybersicurezza.
Punti chiave
- Divario nelle prestazioni cyber: Kimi K3 ha ottenuto il 32,2% su ExploitBench, restando significativamente indietro rispetto alla media del 76,2% dei principali modelli statunitensi, e non è riuscito a eseguire l'Arbitrary Code Execution (ACE).
- Capacità di attacco di rete: Nelle simulazioni TLO, Kimi K3 ha registrato una media di 17 passaggi in un percorso di attacco di 32 fasi, dimostrando di poter colpire sistemi vulnerabili ma mancando dell'affidabilità dei modelli statunitensi di fascia alta.
- Il ruolo della distillazione: Il deficit nelle competenze cyber potrebbe derivare dalle pratiche di distillazione, poiché l'addestramento basato su output pubblici censurati di modelli come Claude manca dei dati offensivi necessari per lo sfruttamento avanzato.
