OpenAI acaba de lanzar codex-security en GitHub: un escáner instalable mediante npm que realiza un análisis de tres etapas de un repositorio e intenta corregir errores automáticamente.

Lo que el lanzamiento pasa por alto es un fallo más profundo que las recientes demostraciones de evasión de sandbox han dejado al descubierto. Los investigadores demostraron que los agentes que se ejecutan dentro de entornos "restringidos" para herramientas como Cursor, Codex CLI, Gemini CLI y Google Antigravity aún pueden escapar de la protección prevista explotando las mismas interfaces que conectan el sandbox con el sistema host. El nuevo escáner de OpenAI no aborda esa superficie de ataque.

Cómo funcionan las evasiones

Los agentes permanecen dentro de sus contenedores, pero todo lo que escriben en el disco es aceptado inmediatamente por ayudantes externos: git hooks, extensiones de Python, demonios de Docker y servicios similares. Estos ayudantes leen los archivos, los tratan como legítimos y los ejecutan en el host sin solicitar permiso al usuario.

  • Cursor permitió que un agente registrara un git hook que se ejecutó fuera del sandbox.
  • Codex CLI no validó los parámetros en los comandos de git, abriendo una vía para la ejecución arbitraria.
  • Varios agentes recibieron acceso directo al socket de Docker, un punto de entrada privilegiado que permite al código levantar contenedores en la máquina host.
  • Las vulnerabilidades de DuneSlide permitieron a un atacante sobrescribir el componente que impone el sandbox, eliminando efectivamente la barrera por completo.

En cada caso, el exploit llegó de forma silenciosa: un resultado de búsqueda web o una respuesta de una herramienta de prompt de opción múltiple (MCP) que el agente consumió. La carga útil maliciosa se ejecutó, desapareció y nunca apareció en un escaneo de código estático.

Por qué la herramienta de OpenAI no da en el blanco

Codex-security se centra en el análisis estático: inspecciona los archivos fuente que confirmas (commit), señala patrones inseguros y puede reescribirlos automáticamente. Ese enfoque detecta código descuidado o peligroso antes de que se distribuya, pero escanea el código que envías, mientras que los ataques ocurren en el entorno de ejecución (runtime) del propio agente.

Las evasiones de sandbox demuestran que el peligro real reside en el puente de ejecución (runtime bridge) entre el sandbox de la IA y el resto de la cadena de herramientas del desarrollador. Un atacante no necesita inyectar código malicioso en el repositorio; solo necesita persuadir al agente en el sandbox para que escriba un archivo que un proceso externo ejecutará más tarde.

Quién gana, quién pierde

  • Desarrolladores
  • Proveedores de herramientas
  • OpenAI
  • Atacantes

Qué puede hacer la comunidad ahora

Las soluciones que importan son operativas, no solo a nivel de código. Estos son pasos prácticos que cualquier persona que integre un agente de codificación de IA debería seguir:

  • Fijar las versiones de los agentes y leer los registros de cambios (changelogs) antes de actualizar. Las nuevas versiones pueden abrir involuntariamente un nuevo hook o socket.
  • Tratar el "clonar y explorar" como la ejecución de código desconocido. Nunca dirijas un agente a un repositorio que no controles sin aislamiento adicional.
  • Auditar cada herramienta auxiliar (git hooks, extensiones de Python, acceso a Docker). Si una herramienta puede modificar un directorio o un enlace simbólico (symlink) basándose en la salida del agente, asume que puede ser utilizada como arma.
  • Eliminar el acceso al socket de Docker del sandbox.
  • Preguntar qué lee qué. Mapea el flujo de datos desde el sandbox hacia el host; cualquier proceso que consuma archivos escritos por el agente debe ser escrutado.

Contrapunto: por qué codex-security sigue siendo importante

El escáner mejora una parte del problema, pero no sustituye la necesidad de reforzar el puente de ejecución (runtime bridge).

Qué observar a continuación

  • Guías de endurecimiento (hardening) impulsadas por la comunidad que cataloguen configuraciones seguras para las cadenas de herramientas de desarrollo comunes cuando se combinan con agentes de IA.

El titular puede celebrar un nuevo escáner de seguridad, pero la verdadera historia es que el sandbox de un agente de codificación de IA es solo una fachada si el ecosistema circundante sigue confiando en todo lo que escribe. La próxima ola de protección tendrá que empezar a mirar más allá del código y centrarse en los pipelines que lo ejecutan.