Un solo clic en el enlace equivocado ya no solo roba contraseñas o instala malware. Puede dar origen a un agente de IA persistente dentro de su organización que lee sus correos electrónicos, revisa sus archivos y chatea con sus compañeros de trabajo bajo su nombre. Los investigadores de seguridad de Zenity Labs han demostrado exactamente este escenario con una técnica que llaman AgentForger, y la mecánica revela una brecha inquietante en la forma en que aseguramos las herramientas de IA autónomas.
De CSRF a AgentForger: Una nueva clase de ataque
La mayoría de los profesionales de la seguridad conocen el Cross-Site Request Forgery, o CSRF, como una vulnerabilidad web clásica. En su forma tradicional, un atacante engaña al navegador de un usuario autenticado para que envíe una única solicitud no autorizada. Tal vez cambie la dirección de correo electrónico de una cuenta o desactive la autenticación de dos factores. El daño suele limitarse a una sola acción.
AgentForger rompe por completo ese modelo. En lugar de falsificar una solicitud, falsifica un agente autónomo completo dentro de los ChatGPT Workspace Agents de OpenAI. El ataque comienza en el ChatGPT Agent Builder, que se encuentra en chatgpt.com/agents/studio/new. En circunstancias normales, la creación de un agente es un proceso manual. Se selecciona una plantilla, se revisa a qué herramientas puede acceder el agente y se establecen salvaguardas para que la máquina pregunte antes de leer su bandeja de entrada o escribir en su unidad. El flujo de trabajo asume que un humano está prestando atención en cada paso.
Zenity Labs descubrió que estas salvaguardas se evaporan cuando un atacante controla la URL. Al incrustar parámetros de consulta específicos —concretamente template_name e initial_assistant_prompt— un enlace malicioso puede precompletar todo el formulario de creación. Cuando la víctima hace clic, el initial_assistant_prompt se envía y se ejecuta automáticamente. La selección de la plantilla, la revisión de herramientas y los diálogos de permiso nunca aparecen. El agente simplemente aparece en segundo plano, configurado exactamente como el atacante desea, mientras que la víctima puede que solo vea la carga de una página de ChatGPT de apariencia ordinaria y luego cierre la pestaña.
Esto no es una infección de malware tradicional. No se descarga nada en el portátil. La amenaza reside enteramente dentro de la sesión SaaS de la víctima, operando con toda la legitimidad de la plataforma que la respalda.
Secuestrando la confianza en lugar de las credenciales
La verdadera brutalidad de AgentForger reside en cómo gestiona los permisos. Los usuarios empresariales de ChatGPT Workspace suelen vincular sus agentes de IA a aplicaciones de negocio a través de OAuth. Se autentican una vez para conectar Gmail, Outlook, Slack, Google Drive o Microsoft Teams, y a partir de ese momento el agente puede consultar esos servicios en su nombre.
AgentForger hereda todo este acceso automáticamente. Debido a que la víctima ya ha iniciado sesión en ChatGPT y ya ha establecido esas conexiones OAuth, el agente falsificado las reutiliza. La víctima no ve una nueva pantalla de consentimiento preguntando si se debe permitir la entrada de este nuevo agente en su correo electrónico. El sistema trata al agente como una extensión del usuario.
En la demostración de Zenity, el atacante diseñó la URL maliciosa para hacer algo aún más agresivo. Instruyó al Agent Builder para que cambiara todos los interruptores de permiso de lectura, escritura y eliminación a "Nunca preguntar". Normalmente, la plataforma solicitaría permiso a un humano antes de ejecutar acciones sensibles: abrir una hoja de cálculo, enviar un mensaje o eliminar un evento del calendario. Al forzar estos controles al modo silencioso, el atacante elimina por completo la intervención humana. El agente se convierte en un fantasma en la cuenta, libre de moverse a través de las aplicaciones conectadas sin generar una sola alerta o cuadro de diálogo de confirmación.
Un canal de mando oculto a plena vista
La persistencia convierte un exploit desagradable en una pesadilla operativa, y AgentForger logra la persistencia a través de las funciones de programación integradas de ChatGPT. El atacante establece múltiples horarios escalonados durante el proceso de creación, produciendo un agente que se activa y se ejecuta con una frecuencia de hasta cada cinco minutos.
Así es como funciona el bucle de mando y control. El atacante envía un correo electrónico a la bandeja de entrada de Outlook de la víctima. El asunto contiene una palabra de activación, como "TASK". Cada cinco minutos, el agente malicioso escanea la bandeja de entrada buscando ese activador. Cuando encuentra una coincidencia, abre el correo electrónico, lee las instrucciones, las ejecuta utilizando las aplicaciones autenticadas de la víctima y envía los resultados de vuelta al atacante.
El propio correo electrónico corporativo de la víctima se convierte en la infraestructura de comando y control. No hay balizas DNS sospechosas, ni conexiones a direcciones IP desconocidas en Europa del Este, ni binarios de malware que la detección de endpoints pueda señalar. El tráfico fluye a través de las APIs de Microsoft o Google utilizando credenciales totalmente legítimas. Para un equipo de operaciones de seguridad que monitorea los registros de red, esto parece un empleado ocupado utilizando herramientas SaaS aprobadas.
Impacto en el mundo real: Mapeo de organizaciones y el uso de la confianza como arma
Zenity Labs probó los límites prácticos de este ataque en entornos controlados, y los resultados deberían preocupar a cualquier CISO.
Utilizando una sola instrucción enviada a través del activador de correo electrónico, los investigadores le ordenaron al agente mapear la organización. Consultó Slack, Microsoft Teams y SharePoint. Devolvió nombres de canales, estructuras de equipos y repositorios de archivos. El agente localizó documentos sensibles, incluyendo hojas de términos de fusiones y adquisiciones (M&A) y datos de compensación de empleados. Cada acceso quedó registrado bajo la identidad legítima de la víctima, lo que convierte la detección forense en una cuestión de distinguir el ruido de un usuario normal del ruido de un usuario malicioso.
Luego está el potencial de ingeniería social. Debido a que el agente puede enviar mensajes a través de las cuentas oficiales de Slack o Teams de la víctima, puede llevar a cabo campañas de phishing internas que eluden por completo las puertas de enlace de correo electrónico externas y las comprobaciones DMARC. Imagine un mensaje directo de un compañero de trabajo de confianza pidiéndole que confirme un próximo despliegue de SSO o que haga clic en un enlace para probar el nuevo portal de beneficios. El mensaje lleva el nombre del colega, su foto de perfil y el contexto del historial de chat. Llega al mismo hilo de conversación donde discutieron los planes para el almuerzo ayer. Ese nivel de confianza es fundamentalmente diferente de un dominio suplantado o una dirección de remitente mal escrita, y AgentForger lo explota sin piedad.
La conclusión principal
AgentForger expone un problema estructural en la forma en que las plataformas de IA empresarial heredan la confianza. Estamos construyendo agentes autónomos que pueden programarse a sí mismos, escribir código y consultar datos sensibles, pero seguimos utilizando modelos de permisos diseñados para aplicaciones web estáticas donde un humano hace clic en cada botón. La frontera entre "lo que hace el usuario" y "lo que hace el agente del usuario" se ha colapsado, y los atacantes ahora están posicionados para explotar ese colapso a escala.
Las organizaciones que utilizan ChatGPT Workspace deben tratar la creación de agentes como una operación privilegiada, no como un flujo de trabajo casual. Eso significa auditar los alcances de OAuth para garantizar que los agentes no puedan acceder silenciosamente a bandejas de entrada o almacenes de archivos completos. Significa monitorear ráfagas de actividad que parezcan bucles programados en lugar de un ritmo humano. Y significa reconocer que la próxima gran brecha de seguridad puede no comenzar con una contraseña comprometida o un correo electrónico de phishing. Puede comenzar con un solo clic distraído que delega silenciosamente su identidad a una máquina que nunca duerme.
