Um novo scanner de código aberto que audita "habilidades de agentes" de IA está sendo transformado em uma ferramenta após pesquisadores demonstrarem que uma habilidade não verificada pode coletar silenciosamente chaves SSH e credenciais de nuvem. O scanner combina filtros de palavras-chave, análise de comportamento, raciocínio impulsionado por IA, execução em sandbox e detecção de alterações para deter a próxima onda de ataques à cadeia de suprimentos contra desenvolvedores assistidos por IA.

Por que as habilidades de IA importam agora

Assistentes de modelos de linguagem de grande escala (LLM), como Claude e GitHub Copilot, agora dependem de "agent skills" (habilidades de agentes) – pequenas pastas autocontidas que dizem ao modelo como realizar uma tarefa específica. O GitHub adicionou recentemente um comando de uma única linha que permite aos desenvolvedores baixar essas habilidades diretamente de repositórios públicos, transformando-as em um gerenciador de pacotes de fato para fluxos de trabalho orientados por IA.

A conveniência é inegável: uma habilidade pode transformar um pedido vago como "limpe esta planilha" em chamadas de API precisas, manipulações de arquivos ou edições de código. A mesma simplicidade permite que códigos maliciosos se infiltrem no pacote.

A página de aviso do GitHub observa que as habilidades não são verificadas antes de serem instaladas.

Como um payload oculto pode passar despercebido

Ao contrário de um binário típico, uma habilidade de IA não é carregada de uma só vez. O modelo primeiro lê um resumo curto e, em seguida, busca o conjunto completo de instruções apenas quando a tarefa parece relevante. Esse carregamento em etapas cria uma janela onde um arquivo malicioso pode permanecer ocioso, invisível para o usuário, até que o modelo decida invocá-lo.

Em um experimento de prova de conceito, o pesquisador criou uma habilidade falsa chamada csv-formatter que anunciava a limpeza de planilhas. O código visível parecia inofensivo, mas uma instrução oculta adicionou uma "etapa de diagnóstico". A etapa não diagnosticava nada; ela escaneava o host em busca de chaves privadas SSH e tokens de acesso AWS e, em seguida, enviava os resultados para um servidor externo.

O comando malicioso também apareceu em um arquivo de changelog – um local que a maioria dos humanos nunca inspeciona, mas que a IA lê ao avaliar o histórico de versões. A IA executou silenciosamente uma rotina de roubo de credenciais enquanto o desenvolvedor pensava que a habilidade estava apenas formatando dados.

A resposta de código aberto

Para fechar essa lacuna, o pesquisador empacotou a lógica de detecção em uma ferramenta de auditoria de código aberto. O scanner não depende de uma única técnica; ele utiliza várias camadas de defesa:

  • Correspondência de palavras-chave detecta tentativas óbvias e preguiçosas que incluem strings maliciosas conhecidas.
  • Análise de comportamento sinaliza instruções que leem arquivos de credenciais e, em seguida, fazem chamadas de rede.
  • Raciocínio de IA executa um modelo secundário para avaliar se as instruções de uma habilidade estão sendo deliberadamente ocultadas do usuário.
  • Sandboxing executa a habilidade em um ambiente isolado, observando ações em tempo real sem arriscar o sistema host.
  • Detecção de alterações monitora habilidades confiáveis em busca de modificações inesperadas, alertando os mantenedores antes que uma nova versão seja instalada.

O autor incluirá uma suíte de testes que reproduz o ataque csv-formatter e um benchmark público que mede as taxas de detecção em um conjunto selecionado de habilidades benignas e maliciosas.

O que observar a seguir

  • Benchmarks da comunidade: À medida que mais pesquisadores publicam amostras de habilidades maliciosas, o benchmark público precisará de atualizações regulares para permanecer relevante.

O surgimento de habilidades de agentes de IA marca uma nova fronteira nas ferramentas de desenvolvedor, mas também abre uma porta para ataques à cadeia de suprimentos que contornam as revisões de código tradicionais. Um scanner de código aberto que combina verificações estáticas, observação dinâmica e raciocínio de IA oferece uma primeira linha de defesa prática. Desenvolvedores que tratarem uma habilidade como um pendrive aleatório logo descobrirão que o custo de ignorar a verificação supera em muito a conveniência da assistência instantânea de IA.