Imagine que você é um engenheiro sênior de segurança de aplicações em uma empresa de serviços financeiros. Você insere um trecho de um código de autenticação desenvolvido internamente em um modelo de IA de fronteira e pede que ele identifique falhas de lógica. Em vez de uma análise, você recebe um sermão. O modelo recusa-se sob o argumento de que você pode usar as informações para “explorar um sistema”. Você não é um criminoso. Você é a pessoa contratada para deter criminosos. No entanto, o mecanismo de proteção (guardrail) trata ambos os papéis como indistinguíveis.

Este cenário está se tornando rotineiro. À medida que os grandes laboratórios de IA reforçam os protocolos de segurança para evitar o uso malicioso, eles colidem frontalmente com os fluxos de trabalho de profissionais legítimos de cibersegurança. O resultado é um paradoxo crescente: as mesmas ferramentas promovidas como multiplicadores de força para a engenharia de software estão sendo retidas dos especialistas que protegem a infraestrutura crítica.

O Atrito entre Safety e Security

Os principais desenvolvedores de IA não ignoraram inteiramente a comunidade de cibersegurança. A OpenAI executa um programa chamado Trusted Access for Cyber. A Anthropic opera um Cyber Verification Program. Ambos são projetados para permitir que usuários verificados contornem certos mecanismos de recusa, para que possam realizar pesquisas legítimas. Em teoria, esses portões separam os bons atores dos maus.

Na prática, muitos pesquisadores de segurança ofensiva e defensores de rede os vivenciam como obstáculos burocráticos. Os processos de verificação podem ser opacos. Os cronogramas de aprovação são incertos. Mesmo após a aceitação, pesquisadores relatam que o acesso elevado nem sempre funciona de forma confiável em diferentes versões de modelos ou threads de conversa. Para equipes que correm para corrigir vulnerabilidades sob exploração ativa, esse atrito importa.

A tensão entre Washington e o Vale do Silício atingiu um ponto crítico notável quando o governo dos EUA impôs controles de exportação aos modelos Mythos e Fable da Anthropic. As restrições seguiram relatos de que indivíduos haviam contornado os mecanismos de proteção (guardrails) dos modelos para facilitar ataques cibernéticos. Os reguladores agiram rapidamente para tratar esses sistemas como mercadorias de exportação excepcionalmente perigosas. Desde então, os controles foram levantados ou modificados, mas o episódio enviou um sinal claro: modelos de IA de alta capacidade são cada vez mais vistos como potenciais dispositivos de destruição em massa, em vez de instrumentos técnicos de uso geral. Para os defensores que dependem deles, essa percepção se traduz em maior escrutínio, acesso mais lento e uma suspeita subjacente de que a pesquisa de segurança é apenas "hacking" com outro nome.

Por que Defesa e Ataque são Inseparáveis

O cerne do conflito não é administrativo. É técnico. As mesmas capacidades necessárias para defender uma rede são quase idênticas às necessárias para atacá-la.

Chris Anley, Cientista-Chefe na NCC Group, usa uma analogia simples: a IA é um martelo. Você pode usá-lo para construir uma casa ou para quebrar uma janela. A ferramenta em si não sabe a diferença. Na cibersegurança, essa dualidade é inevitável. Quando um profissional pede a um modelo para “corrigir este código”, a solicitação aciona uma ação defensiva. Mas o processo de raciocínio que produz a correção — identificar funções inseguras, rastrear entradas não confiáveis, mapear fluxos de execução — inevitavelmente revela como a vulnerabilidade pode ser acionada. A explicação serve como um roteiro para a exploração.

Como as equipes de segurança de IA frequentemente treinam os modelos para recusar qualquer comando que cheire a exploração, os sistemas frequentemente corrigem em excesso. Um pesquisador que pergunta como sanitizar a entrada do usuário recebe uma resposta. Um pesquisador que pergunta como um