A Anthropic e a OpenAI abriram, cada uma, uma nova trilha de pesquisa que permite que equipes de segurança credenciadas trabalhem com modelos de IA desprovidos da maioria dos filtros de segurança. O “Cyber Verification Program” da Anthropic e o “Trusted Access for Cyber” da OpenAI oferecem a pesquisadores aprovados acesso direto a modelos de linguagem poderosos que podem gerar código, prompts e instruções sem restrições. A medida é importante porque cria uma bifurcação clara na cadeia de suprimentos de IA: um punhado de insiders pode investigar as versões mais fracas, enquanto o resto do mundo permanece atrás de proteções mais fortes.
Por que os programas surgiram
Ambas as empresas afirmam que as iniciativas visam acelerar a descoberta de vulnerabilidades que poderiam ser transformadas em armas contra seus serviços. Ao entregar a um grupo controlado de especialistas um ambiente de testes (sandbox) com menos restrições, elas esperam revelar vetores de ataque antes que atores maliciosos os encontrem. A abordagem espelha a segurança de software tradicional, onde desenvolvedores lançam versões de “bug-bounty” para um público selecionado.
Novo cálculo de risco para defensores
O outro lado é um modelo de acesso de dois níveis que força cada organização a traçar uma linha entre “pesquisador” e “hacker”. Essa linha torna-se agora uma superfície de ataque potencial. Se um invasor roubar credenciais, explorar o acesso de um insider ou enganar o processo de credenciamento, ele poderá contornar as proteções que protegem a maioria dos usuários. Uma vez dentro, o modelo sem restrições pode ser induzido a:
- Gerar scripts de phishing que evitem a detecção
- Criar exploits de dia zero com trechos de código detalhados
- Produzir prompts de engenharia social convincentes, adaptados a alvos específicos
Equipes de segurança que construíram defesas baseadas na premissa de que os resultados da IA são sempre filtrados devem repensar essa premissa.
Como os defensores podem responder
- Trate os programas como um vetor de ameaça. Assuma que os adversários tentarão infiltrar o pipeline de credenciamento e monitore padrões de login anormais em plataformas de IA.
- Expanda a detecção para além da nuvem. Procure por código ou texto gerado por IA no tráfego de saída, especialmente de contas privilegiadas.
- Implemente controles de política de forma rígida. Aplique regras estritas de “privilégio mínimo” para qualquer uso interno de serviços de IA externos e segmente ambientes que possam ser alcançados por uma credencial comprometida.
- Colabore com os fornecedores. Mantenha-se engajado com os canais de ligação de segurança da Anthropic e da OpenAI para receber alertas sobre mudanças nos critérios de acesso ou abusos descobertos.
O contraponto
Os defensores argumentam que, sem um canal seguro para investigações profundas, as vulnerabilidades permanecerão ocultas até serem exploradas no mundo real. Portanto, os programas poderiam reduzir a superfície de ataque geral ao revelar falhas precocemente. A compensação é que um nível “menos protegido” convida ao abuso oportunista.
O que observar
- Atualizações no processo de credenciamento de qualquer uma das empresas
- Relatos de uso indevido decorrentes dos programas
- Mudanças em toda a indústria na forma como as superfícies de ataque relacionadas à IA são catalogadas
O ponto principal: as novas trilhas de pesquisa oferecem ferramentas poderosas aos pesquisadores de segurança, mas também entregam as mesmas ferramentas a qualquer pessoa que consiga passar pelo portão. As equipes de defesa devem tratar os programas tanto como uma fonte de insights quanto como uma nova via de ataque.
