A Anthropic anunciou que, a partir de 14 de agosto, o Claude Code deixará de solicitar que os usuários cliquem em “aprovar” para cada chamada de ferramenta. Em vez disso, um classificador de risco baseado em IA decidirá quais ações precisam de revisão humana. Um estudo com 1.053 testadores mostrou que 97% dos cliques ocorreram sem a leitura do prompt, e o classificador detectou 89% das ações prejudiciais, enquanto os humanos detectaram apenas 13,6%.
Por que o antigo modelo de “clique para aprovar” deixou a desejar
O fluxo de trabalho antigo forçava um humano a confirmar cada ação externa — como fazer push de código ou excluir arquivos — clicando em um botão. Na prática, os usuários tratavam o diálogo como uma formalidade e aprovavam de forma reflexiva. Os números do estudo expõem o problema: quase todos os cliques eram reflexos, e os poucos avisos genuínos que chamaram a atenção deixaram passar a maioria das operações de risco. Quando uma barreira de segurança desaparece, a segurança do sistema se deteriora.
O que o novo classificador faz
A substituição da Anthropic é um modelo treinado que avalia cada ação pendente e interrompe apenas quando a operação se enquadra em uma de três categorias:
- Irreversíveis – ações que não podem ser desfeitas, como um force-push em um repositório ou a exclusão de uma tabela de banco de dados.
- Destrutivas – exclusões em massa ou sobrescrita de arquivos que podem apagar o trabalho realizado.
- Voltadas para o exterior – etapas que expõem código ou mensagens a sistemas externos, como abrir um pull request ou enviar uma notificação no Slack.
Se uma ação não atender a nenhum desses critérios, o modelo permitirá que ela prossiga automaticamente, encerrando a enxurrada de prompts que os usuários ignoravam.
Limites de uma abordagem baseada apenas em IA
O classificador não é uma salvaguarda universal. Ele aprendeu noções gerais de dano, não as especificidades de qualquer base de código. Uma pasta chamada “tmp” pode ser inofensiva na maioria dos projetos, mas pode conter artefatos de build críticos no seu; o modelo provavelmente a consideraria segura. O desempenho do estudo não garante resultados idênticos em todos os ambientes de produção. Casos de borda — especialmente aqueles que envolvem ferramentas personalizadas ou infraestrutura sensível — ainda precisam de configurações de permissão explícitas ou monitoramento extra.
O que os usuários precisam fazer agora
- Revise o novo modo de permissão: Os planos Pro, Max e Team adotarão o classificador automaticamente. Se você depende de um fluxo de trabalho de permissão personalizado, verifique se ele ainda está alinhado com suas políticas de segurança.
- Identifique ações de alto risco: Mapeie seus pipelines de CI/CD e scripts de implantação para as três categorias de gatilho. Ajuste os scripts que realizam etapas irreversíveis ou destrutivas para incluir salvaguardas explícitas, caso o classificador padrão seja insuficiente.
- Monitore os alertas do classificador: Acompanhe a frequência e a precisão das interrupções. O feedback precoce ajudará a Anthropic a ajustar o modelo e pode levar você a reativar as confirmações manuais para fluxos de trabalho específicos.
O que observar a seguir
A mudança de cliques por reflexo humano para um modelo treinado é uma tentativa clara de fechar uma lacuna de segurança que existia em muitos pipelines de CI.
Fonte: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
