Kimi K3 hinkt US-Frontier-Modellen bei Cyber-Exploits hinterher: Die Distillations-Lücke

Eine gemeinsame Bewertung durch das British AI Security Institute (UK AISI) und das U.S. Center for AI Standards and Innovation (CAISI) hat eine erhebliche Fähigkeitslücke bei offensiven Cyber-Operationen zwischen chinesischen und US-amerikanischen KI-Modellen aufgedeckt. Während Kimi K3 von Moonshot AI vielversprechend erscheint, bleibt es bei komplexen Software-Exploits und Netzwerkangriffen deutlich hinter den führenden amerikanischen Frontier-Modellen zurück.

ExploitBench: Die Lücke in der Schwachstellenforschung

Um die Fähigkeiten in der Exploit-Entwicklung zu messen, nutzten Forscher ExploitBench, einen Benchmark der Carnegie Mellon University, der 41 Schwachstellen umfasst, die nach 2023 in der V8-Engine von Chrome gefunden wurden. Die Ergebnisse zeigten eine deutliche Leistungsdifferenz. Führende US-Modelle erreichten eine durchschnittliche Punktzahl von 76,2 %, während Kimi K3 mit 32,2 % signifikant niedriger abschnitt. Obwohl Kimi K3 Chinas GLM-5.2 (24,4 %) übertraf, gelang es ihm nicht, die höchste Stufe der Exploitierung zu erreichen: Arbitrary Code Execution (ACE).

Im Gegensatz dazu erreichten die erstklassigen US-Modelle in 20 der 41 getesteten Aufgaben erfolgreich ACE, was die volle Kontrolle über die Zielsysteme ermöglichte – ein Grad an Raffinesse, den Kimi K3 nicht replizieren konnte.

Simulation von Netzwerkangriffen via „The Last Ones“

Die Bewertung testete die Modelle zudem mit „The Last Ones“ (TLO), einer Simulation eines komplexen, 32-stufigen Unternehmensnetzwerk-Angriffs, der 20 Hosts über vier Subnetze umfasst. Dieser Test ist darauf ausgelegt, die Fähigkeit eines Agenten zu messen, mehrstufige Eindringpfade zu navigieren.

Kimi K3 erreichte durchschnittlich 17 von 32 Schritten, was eine mittlere Leistungsfähigkeit demonstriert. Während es den vollständigen Angriffspfad in einem von zehn Versuchen abschloss, fehlte ihm die Konsistenz der US-Modelle, die im Durchschnitt 28,5 Schritte erreichten. Die Ergebnisse legen nahe, dass Kimi K3 zwar in der Lage ist, schwach verteidigte Unternehmenssysteme autonom anzugreifen, es jedoch der Zuverlässigkeit westlicher Frontier-Modelle fehlt, um komplexe, langkettige Operationen auszuführen.

Die Distillations-Theorie: Warum die Lücke existiert

Eine kritische Frage bleibt: Warum hinken chinesische Modelle bei Cyber-Aufgaben hinterher, selbst wenn sie bei allgemeinen Benchmarks gut abschneiden? Der Bericht legt nahe, dass dies auf „Distillation“ zurückzuführen sein könnte – die Praxis, hochwertige Ausgaben von Frontier-Modellen (wie Anthropic's Claude) als Trainingsdaten zu verwenden.

Falls Moonshot AI Distillation zur Ausbildung von Kimi K3 genutzt hat, haben sie wahrscheinlich kritische cyber-offensive Daten übersehen. Führende US-Modelle setzen strenge Sicherheitsklassifikatoren ein, die fortgeschrittene offensive Anfragen blockieren. Folglich wäre ein Datensatz, der aus den öffentlichen Ausgaben dieser Modelle erstellt wurde, naturgemäß arm an genau dem Wissen, das für hochgradige Exploitierung erforderlich ist. Dies erklärt, wie Kimi K3 westliche Modelle in allgemeiner Programmierung und logischem Denken erreichen kann, während es bei spezialisierten offensiven Cyber-Aufgaben signifikant versagt.

Wachsende Fähigkeiten und anhaltende Risiken

Trotz der aktuellen Lücke zeigt die Zeitreihenanalyse von CAISI, dass sowohl US-amerikanische als auch chinesische Modelle eine aufwärtsgerichtete, Elo-basierte Trajektorie aufweisen. Die Leistungslücke bei Open-Weight-Modellen hat sich von sechs bis zehn Monaten zu Beginn des Jahres 2025 auf erst kürzlich vier bis sieben Monate verringert. Das UK AISI warnt, dass diese schrumpfende Lücke nicht gleichbedeutend mit Sicherheit ist; die wachsenden Fähigkeiten von Open-Weight-Modellen stellen ein „anhaltendes und irreversibles Missbrauchsrisiko“ in der globalen Cybersicherheitslandschaft dar.

Wichtigste Erkenntnisse

  • Cyber-Leistungslücke: Kimi K3 erreichte auf ExploitBench 32,2 % und blieb damit deutlich hinter dem Durchschnitt der führenden US-Modelle von 76,2 % zurück; zudem gelang keine Arbitrary Code Execution (ACE).
  • Netzwerkangriff-Fähigkeit: In TLO-Simulationen erreichte Kimi K3 durchschnittlich 17 Schritte in einem 32-stufigen Angriffspfad, was beweist, dass es verwundbare Systeme angreifen kann, aber nicht die Zuverlässigkeit erstklassiger US-Modelle besitzt.
  • Die Rolle der Distillation: Das Defizit an Cyber-Fähigkeiten könnte aus Distillationspraktiken resultieren, da das Training auf zensierten öffentlichen Ausgaben von Modellen wie Claude die für fortgeschrittene Exploitierung notwendigen offensiven Daten vermissen lässt.