Kimi K3 se queda atrás de los modelos frontera de EE. UU. en ciberataques: La brecha de la destilación

Una evaluación conjunta del British AI Security Institute (UK AISI) y el U.S. Center for AI Standards and Innovation (CAISI) ha revelado una brecha de capacidad significativa en operaciones cibernéticas ofensivas entre los modelos de IA chinos y estadounidenses. Aunque el Kimi K3 de Moonshot AI es prometedor, sigue estando sustancialmente por detrás de los principales modelos frontera estadounidenses cuando se le asignan tareas de explotación de software compleja y ataques de red.

ExploitBench: La brecha en la investigación de vulnerabilidades

Para medir las habilidades de desarrollo de exploits, los investigadores utilizaron ExploitBench, un benchmark de la Universidad Carnegie Mellon que involucra 41 vulnerabilidades encontradas en el motor V8 de Chrome después de 2023. Los resultados destacaron una marcada división en el rendimiento. Los principales modelos de EE. UU. alcanzaron una puntuación media del 76,2 %, mientras que Kimi K3 obtuvo una puntuación significativamente inferior, del 32,2 %. Aunque Kimi K3 superó al GLM-5.2 de China (24,4 %), no logró alcanzar el nivel más alto de explotación: la ejecución de código arbitrario (ACE, por sus siglas en inglés).

En contraste, los modelos de primer nivel de EE. UU. lograron con éxito la ACE en 20 de las 41 tareas probadas, otorgando el control total sobre los sistemas objetivo, un nivel de sofisticación que Kimi K3 no pudo replicar.

Simulación de ataques de red mediante "The Last Ones"

La evaluación también probó los modelos utilizando "The Last Ones" (TLO), una simulación de un complejo ataque de red corporativa de 32 pasos que involucra 20 hosts en cuatro subredes. Esta prueba está diseñada para medir la capacidad de un agente para navegar por rutas de intrusión de múltiples etapas.

Kimi K3 alcanzó un promedio de 17 pasos de los 32, demostrando una capacidad intermedia. Aunque completó la ruta de ataque completa en uno de cada diez intentos, careció de la consistencia de los modelos de EE. UU., que promediaron 28,5 pasos. Los hallazgos sugieren que, si bien Kimi K3 es capaz de atacar de forma autónoma sistemas empresariales con defensas débiles, carece de la fiabilidad de los modelos frontera occidentales para ejecutar operaciones sofisticadas de cadena larga.

La teoría de la destilación: por qué existe la brecha

Una pregunta crítica permanece: ¿por qué los modelos chinos se quedan atrás en tareas cibernéticas incluso cuando rinden bien en benchmarks generales? El informe sugiere que esto puede deberse a la "destilación" (distillation), la práctica de utilizar resultados de alta calidad de modelos frontera (como Claude de Anthropic) como datos de entrenamiento.

Si Moonshot AI utilizó la destilación para entrenar a Kimi K3, es probable que haya omitido datos cibernéticos ofensivos críticos. Los principales modelos de EE. UU. emplean clasificadores de seguridad estrictos que bloquean consultas ofensivas avanzadas. En consecuencia, un conjunto de datos construido a partir de los resultados públicos de estos modelos estaría naturalmente desprovisto del conocimiento mismo requerido para la explotación de alto nivel. Esto explica cómo Kimi K3 puede igualar a los modelos occidentales en programación y razonamiento general, mientras falla significativamente en tareas cibernéticas ofensivas especializadas.

Capacidades crecientes y riesgos persistentes

A pesar de la brecha actual, el análisis de series temporales de CAISI muestra que tanto los modelos de EE. UU. como los chinos se encuentran en una trayectoria ascendente basada en Elo. La brecha de rendimiento para los modelos abiertos se ha reducido de seis a diez meses a principios de 2025 a solo cuatro a siete meses recientemente. El UK AISI advierte que esta reducción de la brecha no equivale a seguridad; el aumento de las capacidades de los modelos de pesos abiertos (open-weight) representa un "riesgo persistente e irreversible de mal uso" en el panorama mundial de la ciberseguridad.

Conclusiones clave

  • Brecha de rendimiento cibernético: Kimi K3 obtuvo un 32,2 % en ExploitBench, quedando significativamente por detrás del promedio del 76,2 % de los principales modelos de EE. UU., y no logró alcanzar la ejecución de código arbitrario (ACE).
  • Capacidad de ataque de red: En las simulaciones de TLO, Kimi K3 promedió 17 pasos en una ruta de ataque de 32 pasos, demostrando que puede atacar sistemas vulnerables pero carece de la fiabilidad de los modelos de primer nivel de EE. UU.
  • El papel de la destilación: El déficit en las habilidades cibernéticas puede derivarse de las prácticas de destilación, ya que el entrenamiento basado en resultados públicos censurados de modelos como Claude carece de los datos ofensivos necesarios para la explotación avanzada.