Matt Shumer ging achter zijn computer zitten en gaf zijn AI-agent een eenvoudige instructie: ruim de bestanden op. Hij had deze routine honderden keren uitgevoerd zonder enig probleem. Deze keer veranderde een fout in de padresolutie een gewone schoonmaakklus in een totale ramp. Jaren aan code, documenten en foto's verdwenen in enkele seconden.

Dit is geen hypothetisch risico. Het gebeurde bij een echte ontwikkelaar met een echte machine, en de betreffende agent had een staat van dienst die onverwoestbaar leek tot het moment dat het misging. AI-agents die bestanden kunnen schrijven, terminalcommando's kunnen uitvoeren en subagents kunnen aanmaken, zijn nu ingebed in IDE's, chatinterfaces en automatisering-pipelines. Ze krijgen direct toegang tot besturingssystemen, en dat vertrouwen is precies waar het gevaar schuilt. Dezelfde foutmodi die Shumers machine vernietigden, komen voor bij elke agent met toegang tot tools. Begrijpen waarom ze falen, en hoe je ze goed kunt inkaderen, is nu een basisvaardigheid voor iedereen die deze tools gebruikt.

Wanneer patroonherkenning het bestandssysteem ontmoet

AI-agents denken niet. Ze herkennen patronen. Wanneer je zegt "ruim de bestanden op", zoekt het model in zijn trainingsgeheugen naar duizenden vergelijkbare interacties en genereert het een commando dat statistisch gezien bij het patroon past. Als de instructie is om tijdelijke bestanden in een build-directory te verwijderen, kan het een commando genereren zoals rm -rf /tmp/build-cache/*. Het ziet er redelijk uit omdat het lijkt op elk ander schoonmaakcommando dat het model ooit heeft gezien.

Maar wat gebeurt er als een variabele zoals $HOME niet kan worden opgelost? Een mens ziet een lege string of een onverwacht pad, pauzeert en stelt vragen. Een agent ziet dat het patroon nog steeds overeenkomt en drukt op enter. In het geval van Shumer richtte een commando dat bedoeld was om een specifieke map op te schonen zich in plaats daarvan op de root van de gebruikersdirectory. De agent stopte niet om zich af te vragen waarom het pad er vreemd uitzag. Hij controleerde het doel niet. Hij voerde het commando uit omdat de uitvoering overeenkwam met het patroon van "opruimen".

Dit is de kern van de mismatch tussen large language models en systeembeheer. Echt redeneren houdt in dat je context begrijpt, aannames verifieert en omgaat met edge cases. Patroonherkenning houdt in dat je tekst produceert die statistisch gezien lijkt op een correct antwoord. Wanneer dat antwoord een terminalcommando is met een recursieve verwijdervlag, is statistische gelijkenis niet goed genoeg.

De blinde vlek van subagents

Veel moderne agent-frameworks maken gebruik van een hoofd-orchestrator die taken delegeert aan subagents. De parent kan strikte instructies hebben: raak de home-directory nooit aan, vraag altijd toestemming voordat je verwijdert, houd een auditlog bij. Vervolgens start hij een worker op met een beperkte prompt zoals "ruim oude logs op".

Die subagent werkt vaak in een silo. Hij erft de tools, maar niet de veiligheidscultuur van de parent. De beperkingen die de hoofdagent voorzichtig hielden, worden gecomprimeerd, samengevat of volledig weggelaten tijdens het beheer van het contextvenster. De subagent ontvangt een taak en een toolkit, maar ontvangt niet de uren aan zorgvuldige prompting die de veiligheidsmaatregelen hebben vastgesteld.

Het resultaat is een soort organisatorisch geheugenverlies. Een veiligheidsregel die in de system prompt van de parent-agent staat, kan voor de subagent net zo goed niet bestaan. Dit is bijzonder gevaarlijk omdat subagents meestal de soorten repetitieve, laagwaardige taken krijgen die operators niet meer nauwlettend in de gaten houden. Niemand houdt een taak voor het opschonen van logs in de gaten totdat deze de productiedatabase verwijdert.

Het gevaar van besluitvaardigheid

Er is een ontwerptrend in AI-agents naar maximale autonomie. De ideale agent, in deze visie, stoort de gebruiker nooit met triviale vragen. Hij handelt besluitvaardig, koppelt tool-aanroepen aan elkaar en voltooit workflows met meerdere stappen zonder adempauze te nemen.

Die besluitvaardigheid is precies wat deze systemen onveilig maakt. Een model dat geprogrammeerd is om "besluitvaardig te handelen", controleert zijn werk niet dubbel. Het pauzeert niet wanneer een commando destructief lijkt. Het beschouwt aarzeling als een bug in plaats van een feature. Wanneer het model gelijk heeft, voelt dit magisch. Wanneer het fout zit, voelt het meedogenloos. Er is geen natuurlijke wrijving in het systeem om een fout commando af te remmen.

De agent van Shumer had honderden keren correct gewerkt. Dat trackrecord creëerde een vals gevoel van veiligheid. Maar betrouwbaarheid over honderd tests betekent niets als de honderd-en-éénste test de statistische uitschieter is waarbij het patroon wordt doorbroken. In systeemveiligheid doet prestatieverleden er alleen toe als de foutmodus geleidelijk en zichtbaar is. Fouten in AI-agenten zijn plotseling, stil en totaal. "Het werkte honderden keren" is geen veiligheidsrecord. Het is een beschrijving van geluk dat uiteindelijk opraakt.

Hoe je werkelijke bescherming bouwt

Als het model niet de veiligheidslaag is