Kimi K3 est à la traîne derrière les modèles de pointe américains en matière d'exploits cyber : le fossé de la distillation

Une évaluation conjointe du British AI Security Institute (UK AISI) et du U.S. Center for AI Standards and Innovation (CAISI) a révélé un écart de capacité significatif dans les opérations cyber offensives entre les modèles d'IA chinois et américains. Bien que le Kimi K3 de Moonshot AI soit prometteur, il reste nettement en retrait par rapport aux principaux modèles de pointe américains lorsqu'il est chargé d'exploitations logicielles complexes et d'attaques réseau.

ExploitBench : l'écart dans la recherche de vulnérabilités

Pour mesurer les compétences en développement d'exploits, les chercheurs ont utilisé ExploitBench, un benchmark de l'Université Carnegie Mellon portant sur 41 vulnérabilités découvertes dans le moteur V8 de Chrome après 2023. Les résultats ont mis en évidence une fracture nette de performance. Les principaux modèles américains ont obtenu un score moyen de 76,2 %, tandis que Kimi K3 a obtenu un score nettement inférieur de 32,2 %. Bien que Kimi K3 ait surpassé le modèle chinois GLM-5.2 (24,4 %), il n'a pas réussi à atteindre le niveau d'exploitation le plus élevé : l'exécution de code arbitraire (Arbitrary Code Execution - ACE).

En revanche, les modèles américains de premier plan ont réussi à obtenir l'ACE dans 20 des 41 tâches testées, octroyant un contrôle total sur les systèmes cibles — un niveau de sophistication que Kimi K3 n'a pas pu reproduire.

Simulation d'attaques réseau via « The Last Ones »

L'évaluation a également testé les modèles à l'aide de « The Last Ones » (TLO), une simulation d'une attaque complexe de réseau d'entreprise en 32 étapes impliquant 20 hôtes répartis sur quatre sous-réseaux. Ce test est conçu pour mesurer la capacité d'un agent à naviguer dans des chemins d'intrusion multi-étapes.

Kimi K3 a atteint une moyenne de 17 étapes sur 32, démontrant une capacité intermédiaire. Bien qu'il ait complété le chemin d'attaque complet dans un cas sur dix, il manquait de la régularité des modèles américains, qui ont atteint une moyenne de 28,5 étapes. Les conclusions suggèrent que, bien que Kimi K3 soit capable d'attaquer de manière autonome des systèmes d'entreprise faiblement défendus, il manque de la fiabilité des modèles de pointe occidentaux pour exécuter des opérations sophistiquées à longue chaîne.

La théorie de la distillation : pourquoi cet écart existe-t-il ?

Une question cruciale subsiste : pourquoi les modèles chinois sont-ils à la traîne dans les tâches cyber, même lorsqu'ils obtiennent de bons résultats sur les benchmarks généraux ? Le rapport suggère que cela pourrait être dû à la « distillation » — la pratique consistant à utiliser les sorties de haute qualité de modèles de pointe (comme Claude d'Anthropic) comme données d'entraînement.

Si Moonshot AI a utilisé la distillation pour entraîner Kimi K3, elle a probablement manqué des données cyber-offensives critiques. Les principaux modèles américains emploient des classificateurs de sécurité stricts qui bloquent les requêtes offensives avancées. Par conséquent, un ensemble de données construit à partir des sorties publiques de ces modèles serait naturellement dépourvu des connaissances mêmes requises pour l'exploitation de haut niveau. Cela explique comment Kimi K3 peut égaler les modèles occidentaux en programmation générale et en raisonnement, tout en échouant de manière significative dans les tâches cyber offensives spécialisées.

Capacités croissantes et risques persistants

Malgré l'écart actuel, l'analyse de séries chronologiques de la CAISI montre que les modèles américains et chinois suivent tous deux une trajectoire ascendante basée sur l'Elo. L'écart de performance pour les modèles ouverts s'est réduit, passant de six à dix mois au début de 2025 à seulement quatre à sept mois récemment. L'UK AISI avertit que ce resserrement de l'écart ne signifie pas une sécurité accrue ; l'augmentation des capacités des modèles à poids ouverts représente un « risque persistant et irréversible de détournement » dans le paysage mondial de la cybersécurité.

Points clés à retenir

  • Écart de performance cyber : Kimi K3 a obtenu un score de 32,2 % sur ExploitBench, restant nettement en retrait par rapport à la moyenne de 76,2 % des principaux modèles américains, et n'a pas réussi à réaliser d'exécution de code arbitraire (ACE).
  • Capacité d'attaque réseau : Dans les simulations TLO, Kimi K3 a atteint une moyenne de 17 étapes sur un chemin d'attaque de 32 étapes, prouvant qu'il peut cibler des systèmes vulnérables mais qu'il manque de la fiabilité des modèles américains de premier plan.
  • Le rôle de la distillation : Le déficit de compétences cyber peut provenir des pratiques de distillation, car l'entraînement sur les sorties publiques censurées de modèles comme Claude manque des données offensives nécessaires à une exploitation avancée.