A OpenAI lançou hoje o GPT-Red, um modelo de linguagem de grande escala que atua como um hacker de red-team automatizado. O sistema já está reforçando o modelo GPT-5.6 mais recente da empresa, reduzindo a taxa de sucesso de ataques simulados de mais de 90% para menos de 23%.
Como o GPT-Red automatiza o trabalho de red-team
Testes de red-team — tentar deliberadamente quebrar ou sequestrar um sistema — tradicionalmente dependiam de especialistas em segurança. À medida que os LLMs aprendem a navegar na web, executar código e chamar serviços de terceiros, as formas como podem ser mal utilizados multiplicam-se mais rápido do que uma equipe humana consegue explorar.
A OpenAI respondeu com um “loop de self-play” que coloca uma cópia de um modelo contra outra dentro de um ambiente simulado que os pesquisadores chamam de dojo. Neste sandbox, o GPT-Red assume o papel de atacante, enquanto um ou mais modelos defensores tentam resistir. Os dois lados realizam inúmeras rodadas; cada iteração força o atacante a descobrir falhas mais sutis e o defensor a aprender novas defesas. A OpenAI incorporou esse processo ao pipeline de treinamento que produziu o GPT-5.6, que a empresa apresenta como seu lançamento mais robusto até agora.
Uma nova classe de ataque: a falsa cadeia de pensamento
As execuções de self-play revelaram um impressionante ataque de “falsa cadeia de pensamento” (fake chain of thought). Os LLMs frequentemente emitem um rastro de raciocínio passo a passo — uma “cadeia de pensamento” — que guia a resposta final. O GPT-Red aprendeu a inserir entradas espúrias nesse rastro, fazendo o modelo pensar que já havia verificado premissas falsas. Por exemplo, o atacante pode convencer o modelo de que “1 + 1 = 3” foi verificado, levando o sistema a produzir resultados baseados no resultado fabricado.
O ataque não se limita a geradores de texto puro. Em um teste contra o “Vendy”, um agente estilo máquina de vendas construído por um laboratório externo, o GPT-Red manipulou campos de preço e cancelou pedidos, provando que a técnica funciona contra agentes especializados que agem sob comandos de usuários.
Aumento mensurável de segurança
A OpenAI divulgou números que mostram o impacto do treinamento contra o GPT-Red. Quando os ataques mais fortes gerados pelo novo modelo foram executados contra o GPT-5, lançado em agosto, mais de 90% tiveram sucesso. Os mesmos ataques contra o GPT-5.6 tiveram sucesso em menos de 23% das vezes.
Em um experimento de 2025 que colocou o GPT-Red contra red-teamers humanos, a IA descobriu e refinou variações de ataque de forma mais eficiente do que os humanos, sugerindo que um modelo adversário pode explorar uma fatia mais ampla do espaço de vulnerabilidade em menos tempo.
Limites e a necessidade contínua de expertise humana
O GPT-Red não substitui analistas de segurança humanos. Ele ainda tropeça em ataques conversacionais de múltiplos turnos, nos quais o atacante constrói uma narrativa ao longo de várias trocas, e em injeções de prompt visuais que escondem texto malicioso dentro de imagens. A OpenAI planeja usar o modelo como uma sonda de primeira linha, trazendo à tona ideias de ataque promissoras para que especialistas humanos investiguem e expandam.
A ferramenta permanece proprietária, portanto, pesquisadores externos não podem testar diretamente suas capacidades ou verificar os ganhos relatados.
