A Anthropic e a OpenAI abriram, cada uma, uma nova trilha de pesquisa que permite que equipes de segurança credenciadas trabalhem com modelos de IA desprovidos da maioria dos filtros de segurança. O “Cyber Verification Program” da Anthropic e o “Trusted Access for Cyber” da OpenAI oferecem a pesquisadores aprovados acesso direto a modelos de linguagem poderosos que podem gerar código, prompts e instruções sem restrições. A medida é importante porque cria uma bifurcação clara na cadeia de suprimentos de IA: um punhado de insiders pode investigar as versões mais fracas, enquanto o resto do mundo permanece atrás de proteções mais fortes.

Por que os programas surgiram

Ambas as empresas afirmam que as iniciativas visam acelerar a descoberta de vulnerabilidades que poderiam ser transformadas em armas contra seus serviços. Ao entregar a um grupo controlado de especialistas um ambiente de testes (sandbox) com menos restrições, elas esperam revelar vetores de ataque antes que atores maliciosos os encontrem. A abordagem espelha a segurança de software tradicional, onde desenvolvedores lançam versões de “bug-bounty” para um público selecionado.

Novo cálculo de risco para defensores

O outro lado é um modelo de acesso de dois níveis que força cada organização a traçar uma linha entre “pesquisador” e “hacker”. Essa linha torna-se agora uma superfície de ataque potencial. Se um invasor roubar credenciais, explorar o acesso de um insider ou enganar o processo de credenciamento, ele poderá contornar as proteções que protegem a maioria dos usuários. Uma vez dentro, o modelo sem restrições pode ser induzido a:

  • Gerar scripts de phishing que evitem a detecção
  • Criar exploits de dia zero com trechos de código detalhados
  • Produzir prompts de engenharia social convincentes, adaptados a alvos específicos

Equipes de segurança que construíram defesas baseadas na premissa de que os resultados da IA são sempre filtrados devem repensar essa premissa.

Como os defensores podem responder

  • Trate os programas como um vetor de ameaça. Assuma que os adversários tentarão infiltrar o pipeline de credenciamento e monitore padrões de login anormais em plataformas de IA.
  • Expanda a detecção para além da nuvem. Procure por código ou texto gerado por IA no tráfego de saída, especialmente de contas privilegiadas.
  • Implemente controles de política de forma rígida. Aplique regras estritas de “privilégio mínimo” para qualquer uso interno de serviços de IA externos e segmente ambientes que possam ser alcançados por uma credencial comprometida.
  • Colabore com os fornecedores. Mantenha-se engajado com os canais de ligação de segurança da Anthropic e da OpenAI para receber alertas sobre mudanças nos critérios de acesso ou abusos descobertos.

O contraponto

Os defensores argumentam que, sem um canal seguro para investigações profundas, as vulnerabilidades permanecerão ocultas até serem exploradas no mundo real. Portanto, os programas poderiam reduzir a superfície de ataque geral ao revelar falhas precocemente. A compensação é que um nível “menos protegido” convida ao abuso oportunista.

O que observar

  • Atualizações no processo de credenciamento de qualquer uma das empresas
  • Relatos de uso indevido decorrentes dos programas
  • Mudanças em toda a indústria na forma como as superfícies de ataque relacionadas à IA são catalogadas

O ponto principal: as novas trilhas de pesquisa oferecem ferramentas poderosas aos pesquisadores de segurança, mas também entregam as mesmas ferramentas a qualquer pessoa que consiga passar pelo portão. As equipes de defesa devem tratar os programas tanto como uma fonte de insights quanto como uma nova via de ataque.