Anthropic a annoncé qu'à partir du 14 août, Claude Code cessera de demander aux utilisateurs de cliquer sur « approuver » pour chaque appel d'outil. À la place, un classificateur de risques piloté par l'IA décidera des actions nécessitant une révision humaine. Une étude menée auprès de 1 053 testeurs a montré que 97 % des clics ont été effectués sans lire l'invite, et que le classificateur a détecté 89 % des actions nuisibles, contre seulement 13,6 % pour les humains.

Pourquoi l'ancien modèle de « clic pour approuver » a échoué

L'ancien flux de travail obligeait un humain à confirmer chaque action externe — comme pousser du code ou supprimer des fichiers — en cliquant sur un bouton. En pratique, les utilisateurs traitaient la boîte de dialogue comme une simple formalité et approuvaient par réflexe. Les chiffres de l'étude exposent le problème : presque chaque clic était un réflexe, et les rares avertissements authentiques ayant attiré l'attention ont manqué la plupart des opérations risquées. Lorsqu'une barrière de sécurité disparaît, la sécurité du système s'érode.

Ce que fait le nouveau classificateur

Le remplaçant proposé par Anthropic est un modèle entraîné qui évalue chaque action en attente et n'interrompt le processus que lorsque l'opération entre dans l'une des trois catégories suivantes :

  • Irréversible – actions qui ne peuvent pas être annulées, comme un force-push vers un dépôt ou la suppression d'une table de base de données.
  • Destructive – suppressions en masse ou écrasement de fichiers susceptibles d'effacer du travail.
  • Orientée vers l'extérieur – étapes qui exposent du code ou des messages à des systèmes externes, comme l'ouverture d'une pull request ou l'envoi d'une notification Slack.

Si une action ne répond à aucun de ces critères, le modèle la laisse se poursuivre automatiquement, mettant fin au déluge d'invites que les utilisateurs ignoraient.

Les limites d'une approche exclusivement basée sur l'IA

Le classificateur n'est pas une protection universelle. Il a appris des notions générales de préjudice, et non les spécificités de chaque base de code. Un dossier nommé « tmp » peut être inoffensif dans la plupart des projets, mais pourrait contenir des artefacts de build critiques dans le vôtre ; le modèle le jugerait probablement sûr. Les performances de l'étude ne garantissent pas des résultats identiques dans tous les environnements de production. Les cas limites — en particulier ceux impliquant des outils personnalisés ou des infrastructures sensibles — nécessitent toujours des paramètres de permission explicites ou une surveillance accrue.

Ce que les utilisateurs doivent faire maintenant

  • Examiner le nouveau mode de permission : Les forfaits Pro, Max et Team adopteront automatiquement le classificateur. Si vous vous appuyez sur un flux de travail de permission personnalisé, vérifiez qu'il est toujours conforme à vos politiques de sécurité.
  • Identifier les actions à haut risque : Cartographiez vos pipelines CI/CD et vos scripts de déploiement selon les trois catégories de déclenchement. Ajustez les scripts qui effectuent des étapes irréversibles ou destructives pour inclure des protections explicites si le classificateur par défaut est insuffisant.
  • Surveiller les alertes du classificateur : Suivez la fréquence et la précision des interruptions. Un retour d'expérience précoce aidera Anthropic à affiner le modèle et pourra vous inciter à réactiver les confirmations manuelles pour certains flux de travail spécifiques.

À surveiller ensuite

Passer des clics réflexes humains à un modèle entraîné est une tentative claire de combler une faille de sécurité qui existait dans de nombreux pipelines CI.

Source : https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg