Anthropic hat angekündigt, dass Claude Code ab dem 14. August nicht mehr verlangen wird, dass Nutzer für jeden Tool-Aufruf auf „approve“ klicken. Stattdessen wird ein KI-gestützter Risiko-Klassifizierer entscheiden, welche Aktionen eine menschliche Überprüfung erfordern. Eine Studie mit 1.053 Testern zeigte, dass 97 % der Klicks erfolgten, ohne dass der Prompt gelesen wurde, und der Klassifizierer 89 % der schädlichen Aktionen erkannte, während Menschen nur 13,6 % erfassten.
Warum das alte „Click to Approve“-Modell versagte
Der alte Workflow zwang einen Menschen dazu, jede externe Aktion – wie das Pushen von Code oder das Löschen von Dateien – durch einen Klick auf eine Schaltfläche zu bestätigen. In der Praxis behandelten die Nutzer den Dialog als reine Formalität und bestätigten reflexartig. Die Zahlen der Studie legen das Problem offen: Fast jeder Klick war ein Reflex, und die wenigen echten Warnungen, die Aufmerksamkeit erhielten, übersahen die meisten riskanten Operationen. Wenn ein Sicherheitsgate verschwindet, erodiert die Systemsicherheit.
Was der neue Klassifizierer macht
Der Ersatz von Anthropic ist ein trainiertes Modell, das jede ausstehende Aktion bewertet und nur dann unterbricht, wenn die Operation in eine der drei folgenden Kategorien fällt:
- Irreversibel – Aktionen, die nicht rückgängig gemacht werden können, wie das Force-Pushing in ein Repository oder das Löschen einer Datenbanktabelle.
- Destruktiv – Massenlöschungen oder das Überschreiben von Dateien, die Arbeit vernichten könnten.
- Nach außen gerichtet – Schritte, die Code oder Nachrichten an externe Systeme exponieren, wie das Erstellen eines Pull Requests oder das Senden einer Slack-Benachrichtigung.
Wenn eine Aktion keines dieser Kriterien erfüllt, lässt das Modell sie automatisch fortfahren, was die Flut an Prompts beendet, die von Nutzern ignoriert wurden.
Grenzen eines reinen KI-Ansatzes
Der Klassifizierer ist keine universelle Sicherheitsmaßnahme. Er hat allgemeine Vorstellungen von Schaden gelernt, nicht die Spezifika einer bestimmten Codebasis. Ein Ordner namens „tmp“ mag in den meisten Projekten harmlos sein, könnte aber in Ihrem Projekt kritische Build-Artefakte enthalten; das Modell würde ihn wahrscheinlich als sicher einstufen. Die Leistung der Studie garantiert keine identischen Ergebnisse in jeder Produktionsumgebung. Grenzfälle – insbesondere solche, die benutzerdefinierte Tools oder sensible Infrastruktur betreffen – benötigen weiterhin explizite Berechtigungseinstellungen oder zusätzliches Monitoring.
Was Nutzer jetzt tun müssen
- Den neuen Berechtigungsmodus überprüfen: Die Pläne Pro, Max und Team werden den Klassifizierer automatisch übernehmen. Wenn Sie sich auf einen benutzerdefinierten Berechtigungs-Workflow verlassen, prüfen Sie, ob dieser weiterhin mit Ihren Sicherheitsrichtlinien übereinstimmt.
- Hochrisiko-Aktionen identifizieren: Ordnen Sie Ihre CI/CD-Pipelines und Deployment-Skripte den drei Trigger-Kategorien zu. Passen Sie Skripte, die irreversible oder destruktive Schritte ausführen, so an, dass sie explizite Sicherheitsvorkehrungen enthalten, falls der Standard-Klassifizierer nicht ausreicht.
- Klassifizierer-Warnungen überwachen: Verfolgen Sie die Häufigkeit und Genauigkeit der Unterbrechungen. Frühes Feedback wird Anthropic helfen, das Modell fein abzustimmen, und könnte Sie dazu veranlassen, manuelle Bestätigungen für bestimmte Workflows wieder zu aktivieren.
Worauf man als Nächstes achten sollte
Der Wechsel von menschlichen Reflex-Klicks zu einem trainierten Modell ist ein klarer Versuch, eine Sicherheitslücke zu schließen, die in vielen CI-Pipelines bestand.
Quelle: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
