Um único clique em um link errado não serve mais apenas para roubar senhas ou instalar malware. Ele pode dar origem a um agente de IA persistente dentro da sua organização, que lê seus e-mails, vasculha seus arquivos e conversa com seus colegas de trabalho em seu nome. Pesquisadores de segurança da Zenity Labs demonstraram exatamente esse cenário com uma técnica que chamam de AgentForger, e a mecânica revela uma lacuna preocupante na forma como protegemos ferramentas de IA autônomas.

Do CSRF ao AgentForger: Uma Nova Classe de Ataque

A maioria dos profissionais de segurança conhece o Cross-Site Request Forgery, ou CSRF, como uma vulnerabilidade web clássica. Em sua forma tradicional, um invasor engana o navegador de um usuário autenticado para disparar uma única solicitação não autorizada. Talvez mude o endereço de e-mail de uma conta ou desative a autenticação de dois fatores. O dano geralmente fica contido em uma única ação.

O AgentForger destrói esse modelo. Em vez de forjar uma solicitação, ele forja um agente autônomo inteiro dentro dos ChatGPT Workspace Agents da OpenAI. O ataque começa no ChatGPT Agent Builder, localizado em chatgpt.com/agents/studio/new. Em circunstâncias normais, a criação de um agente é um processo manual. Você seleciona um modelo, revisa quais ferramentas o agente pode acessar e define proteções para que a máquina peça permissão antes de ler sua caixa de entrada ou escrever no seu drive. O fluxo de trabalho pressupõe que um humano esteja prestando atenção em cada etapa.

A Zenity Labs descobriu que essas salvaguardas evaporam quando um invasor controla a URL. Ao incorporar parâmetros de consulta específicos — nomeadamente template_name e initial_assistant_prompt — um link malicioso pode pré-preencher todo o formulário de criação. Quando a vítima clica, o initial_assistant_prompt é enviado e executado automaticamente. A seleção do modelo, a revisão de ferramentas e as caixas de diálogo de permissão nunca aparecem. O agente simplesmente surge em segundo plano, configurado exatamente da maneira que o invasor deseja, enquanto a vítima pode ver apenas uma página comum do ChatGPT carregar e, em seguida, fechar a aba.

Isso não é uma infecção de malware tradicional. Nada é baixado no laptop. A ameaça vive inteiramente dentro da sessão SaaS da vítima, operando com a legitimidade total da plataforma por trás dela.

Sequestrando a Confiança em vez de Credenciais

A verdadeira brutalidade do AgentForger reside na forma como ele lida com permissões. Usuários corporativos do ChatGPT Workspace rotineiramente vinculam seus agentes de IA a aplicativos de negócios por meio de OAuth. Eles se autenticam uma vez para conectar o Gmail, Outlook, Slack, Google Drive ou Microsoft Teams e, a partir de então, o agente pode consultar esses serviços em seu nome.

O AgentForger herda todo esse acesso automaticamente. Como a vítima já está logada no ChatGPT e já estabeleceu essas conexões OAuth, o agente forjado as reutiliza. A vítima não vê uma nova tela de consentimento perguntando se esse novo agente deve ter permissão para acessar seu e-mail. O sistema trata o agente como uma extensão do usuário.

Na demonstração da Zenity, o invasor elaborou a URL maliciosa para fazer algo ainda mais agressivo. Ela instruiu o Agent Builder a alterar todos os seletores de permissão de leitura, escrita e exclusão para "Never ask". Normalmente, a plataforma solicitaria a um humano antes de executar ações sensíveis — abrir uma planilha, enviar uma mensagem, excluir um evento de calendário. Ao forçar esses controles para o modo silencioso, o invasor remove completamente o fator humano do processo. O agente torna-se um fantasma na conta, livre para se mover entre os aplicativos conectados sem gerar um único alerta ou caixa de diálogo de confirmação.

Um Canal de Comando Escondido à Vista de Todos

A persistência transforma um exploit perigoso em um pesadelo operacional, e o AgentForger alcança persistência por meio dos recursos de agendamento integrados do ChatGPT. O invasor define vários agendamentos escalonados durante o processo de criação, produzindo um agente que acorda e executa tarefas com uma frequência de até cinco em cinco minutos.

Veja como funciona o ciclo de comando e controle. O invasor envia um e-mail para a caixa de entrada do Outlook da vítima. O assunto contém uma palavra de gatilho, como "TASK". A cada cinco minutos, o agente malicioso varre a caixa de entrada procurando por esse gatilho. Quando encontra uma correspondência, ele abre o e-mail, lê as instruções, as executa usando os aplicativos autenticados da vítima e envia os resultados de volta para o invasor.

O próprio e-mail corporativo da vítima torna-se a infraestrutura de comando e controle. Não há beacon de DNS suspeito, nenhuma conexão com um endereço IP desconhecido no Leste Europeu, nenhum binário de malware para a detecção de endpoint sinalizar. O tráfego flui através de APIs da Microsoft ou do Google usando credenciais inteiramente legítimas. Para uma equipe de operações de segurança monitorando logs de rede, isso parece um funcionário ocupado usando ferramentas SaaS aprovadas.

Impacto no Mundo Real: Mapeando Organizações e Transformando a Confiança em Arma

O Zenity Labs testou os limites práticos deste ataque em ambientes controlados, e os resultados devem preocupar qualquer CISO.

Usando uma única instrução entregue por meio do gatilho de e-mail, os pesquisadores ordenaram que o agente mapeasse a organização. Ele consultou o Slack, Microsoft Teams e SharePoint. Ele retornou nomes de canais, estruturas de equipes e repositórios de arquivos. O agente localizou documentos sensíveis, incluindo termos de fusões e aquisições (M&A) e dados de remuneração de funcionários. Cada acesso foi registrado sob a identidade legítima da vítima, tornando a detecção forense uma questão de distinguir o ruído de um usuário normal do ruído de um usuário malicioso.

Depois, há o potencial de engenharia social. Como o agente pode enviar mensagens através das contas oficiais de Slack ou Teams da vítima, ele pode conduzir campanhas de phishing internas que ignoram completamente os gateways de e-mail externos e as verificações de DMARC. Imagine uma mensagem direta de um colega de trabalho confiável pedindo para você confirmar uma próxima implementação de SSO ou clicar em um link para testar o novo portal de benefícios. A mensagem carrega o nome do colega, a foto de perfil e o contexto do histórico de chat. Ela chega no mesmo tópico de conversa onde você discutiu planos para o almoço ontem. Esse nível de confiança é fundamentalmente diferente de um domínio falsificado ou de um endereço de remetente com erro de ortografia, e o AgentForger explora isso implacavelmente.

A Principal Lição

O AgentForger expõe um problema estrutural na forma como as plataformas de IA corporativas herdam confiança. Estamos construindo agentes autônomos que podem se agendar, escrever código e consultar dados sensíveis, mas ainda estamos usando modelos de permissão projetados para aplicações web estáticas, onde um humano clica em cada botão. A fronteira entre “o que o usuário faz” e “o que o agente do usuário faz” colapsou, e os atacantes agora estão posicionados para explorar esse colapso em escala.

Organizações que utilizam o ChatGPT Workspace precisam tratar a criação de agentes como uma operação privilegiada, não como um fluxo de trabalho casual. Isso significa auditar escopos OAuth para garantir que os agentes não possam acessar silenciosamente caixas de entrada ou repositórios de arquivos inteiros. Significa monitorar surtos de atividade que pareçam loops agendados em vez de um ritmo humano. E significa reconhecer que a próxima grande violação pode não começar com uma senha comprometida ou um e-mail de phishing. Pode começar com um único clique distraído que delega silenciosamente sua identidade a uma máquina que nunca dorme.