OpenAI lanzó hoy GPT-Red, un modelo de lenguaje de gran tamaño que actúa como un hacker de red team automatizado. El sistema ya está reforzando el último modelo GPT-5.6 de la compañía, reduciendo drásticamente la tasa de éxito de los ataques simulados de más del 90 % a menos del 23 %.
Cómo GPT-Red automatiza el trabajo de red team
Las pruebas de red team —intentar deliberadamente romper o secuestrar un sistema— han dependido tradicionalmente de expertos en seguridad. A medida que los LLM aprenden a navegar por la web, ejecutar código y llamar a servicios de terceros, las formas en que pueden ser utilizados indebidamente se multiplican más rápido de lo que un equipo humano puede explorar.
OpenAI respondió con un "bucle de auto-juego" (self-play loop) que enfrenta a una copia de un modelo contra otra dentro de un entorno simulado que los investigadores llaman dojo. En este sandbox, GPT-Red asume el papel de atacante mientras uno o más modelos defensores intentan resistir. Ambos bandos ejecutan innumerables rondas; cada iteración obliga al atacante a descubrir fallos más sutiles y al defensor a aprender nuevas defensas. OpenAI integró este proceso en el pipeline de entrenamiento que produjo GPT-5.6, el cual la empresa promociona como su lanzamiento más robusto hasta la fecha.
Una nueva clase de ataque: la cadena de pensamiento falsa
Las ejecuciones de auto-juego descubrieron un sorprendente ataque de "cadena de pensamiento falsa" (fake chain of thought). Los LLM suelen emitir un rastro de razonamiento paso a paso —una "cadena de pensamiento"— que guía la respuesta final. GPT-Red aprendió a insertar entradas espurias en ese rastro, haciendo que el modelo crea que ya ha verificado premisas falsas. Por ejemplo, el atacante puede convencer al modelo de que "1 + 1 = 3" ha sido comprobado, lo que induce al sistema a producir resultados basados en el dato fabricado.
El ataque no se limita a generadores de texto puro. En una prueba contra "Vendy", un agente de estilo máquina expendedora construido por un laboratorio externo, GPT-Red manipuló campos de precios y canceló pedidos, demostrando que la técnica funciona contra agentes especializados que actúan según los comandos del usuario.
Mejora de seguridad medible
OpenAI publicó cifras que muestran el impacto de entrenar contra GPT-Red. Cuando se ejecutaron los ataques más fuertes generados por el nuevo modelo contra el GPT-5 lanzado en agosto, más del 90 % tuvo éxito. Los mismos ataques contra GPT-5.6 tuvieron éxito en menos del 23 % de las ocasiones.
En un experimento de 2025 que enfrentó a GPT-Red contra red-teamers humanos, la IA descubrió y refinó variaciones de ataque de manera más eficiente que los humanos, lo que sugiere que un modelo adversarial puede explorar una porción más amplia del espacio de vulnerabilidades en menos tiempo.
Límites y la continua necesidad de experiencia humana
GPT-Red no reemplaza a los analistas de seguridad humanos. Todavía tropieza con ataques conversacionales de múltiples turnos, donde el atacante construye una narrativa a lo largo de varios intercambios, y con inyecciones de prompts visuales que ocultan texto malicioso dentro de imágenes. OpenAI planea utilizar el modelo como una sonda de primera línea, sacando a la luz ideas de ataque prometedoras para que los expertos humanos las investiguen y amplíen.
La herramienta sigue siendo propietaria, por lo que los investigadores externos no pueden probar directamente sus capacidades ni verificar las mejoras reportadas.
