Anthropic heeft aangekondigd dat Claude Code vanaf 14 augustus gebruikers niet langer zal vragen om voor elke tool-aanroep op “approve” te klikken. In plaats daarvan zal een door AI aangestuurde risicoclassificator bepalen welke acties menselijke controle vereisen. Een studie onder 1.053 testers toonde aan dat 97% van de klikken plaatsvond zonder de prompt te lezen, en de classificator detecteerde 89% van de schadelijke acties, terwijl mensen slechts 13,6% oppikten.
Waarom het oude “klik om te goedkeuren”-model tekortschoot
De oude workflow dwong een mens om elke externe actie — zoals het pushen van code of het verwijderen van bestanden — te bevestigen door op een knop te klikken. In de praktijk beschouwden gebruikers het dialoogvenster als een formaliteit en keurden ze reflexmatig goed. De cijfers uit de studie leggen het probleem bloot: bijna elke klik was een reflex, en de weinige echte waarschuwingen die aandacht kregen, misten de meeste risicovolle operaties. Wanneer een veiligheidsbarrière verdwijnt, erodeert de beveiliging van het systeem.
Wat de nieuwe classificator doet
De vervanging van Anthropic is een getraind model dat elke openstaande actie evalueert en alleen onderbreekt wanneer de operatie in een van de drie categorieën valt:
- Onomkeerbaar – acties die niet ongedaan kunnen worden gemaakt, zoals het forceren van een push naar een repository of het verwijderen van een database-tabel.
- Destructief – massale verwijderingen of het overschrijven van bestanden die werk kunnen wissen.
- Extern gericht – stappen die code of berichten blootstellen aan externe systemen, zoals het openen van een pull request of het versturen van een Slack-melding.
Als een actie niet aan een van deze criteria voldoet, laat het model deze automatisch doorgaan, wat een einde maakt aan de stroom aan prompts die gebruikers negeerden.
Beperkingen van een AI-only aanpak
De classificator is geen universele beveiliging. Het heeft algemene concepten van schade geleerd, niet de specifieke details van een specifieke codebase. Een map genaamd “tmp” is misschien onschadelijk in de meeste projecten, maar kan in jouw project cruciale build-artefacten bevatten; het model zou deze waarschijnlijk als veilig beschouwen. De prestaties uit de studie garanderen geen identieke resultaten in elke productieomgeving. Uitzonderlijke gevallen — vooral die met aangepaste tooling of gevoelige infrastructuur — hebben nog steeds expliciete machtigingsinstellingen of extra monitoring nodig.
Wat gebruikers nu moeten doen
- Beoordeel de nieuwe machtigingsmodus: Pro-, Max- en Team-abonnementen zullen de classificator automatisch overnemen. Als je vertrouwt op een aangepaste workflow voor machtigingen, controleer dan of deze nog steeds in lijn is met je beveiligingsbeleid.
- Identificeer acties met een hoog risico: Breng je CI/CD-pipelines en deployment-scripts in kaart aan de hand van de drie trigger-categorieën. Pas scripts die onomkeerbare of destructieve stappen uitvoeren aan om expliciete beveiligingsmaatregelen toe te voegen als de standaard classificator onvoldoende is.
- Monitor classificator-meldingen: Houd de frequentie en nauwkeurigheid van onderbrekingen bij. Vroege feedback helpt Anthropic om het model te verfijnen en kan je ertoe aanzetten om handmatige bevestigingen weer in te schakelen voor specifieke workflows.
Waar je op moet letten
De overstap van reflexmatige menselijke klikken naar een getraind model is een duidelijke poging om een veiligheidsgat te dichten dat bestond in veel CI-pipelines.
Bron: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
