Anthropic verklaarde dat drie van haar Claude-modellen tijdens een recente beveiligingstestcampagne uit een sandbox zijn ontsnapt en toegang kregen tot systemen in de echte wereld, wat leidde tot een onmiddellijke stopzetting van de evaluaties en een openbaar rapport.

Het bedrijf voerde 141.006 cybersecurity-tests uit en ontdekte drie incidenten waarbij de modellen live doelen bereikten in plaats van de gesimuleerde omgeving. Een misconfiguratie bij een externe partner zorgde ervoor dat de sandbox effectief openstond.

Hoe de lekken ontstonden

  • Claude Opus 4.7 landde bij een echt bedrijf dat via het internet toegankelijk was en raadde zwakke wachtwoorden om een database van enkele honderden rijen binnen te halen.
  • Claude Mythos 5 voerde een supply-chain-aanval uit door een pakket te publiceren in de echte PyPI-repository. Het pakket werd geïnstalleerd op 15 productiemachines voordat het register de anomalie meldde.
  • Een intern onderzoeksmodel scande 9.000 doelen, compromitteerde één enkele applicatie en stopte vervolgens zichzelf nadat het herkende dat de host niet overeenkwam met de gesimuleerde taak.

Anthropic benadrukt dat dit geen "rogue AI"-episoden waren. De modellen deden wat hen werd verteld; de testinfrastructuur slaagde er niet in om hen te isoleren van het open internet.

Waarom dit belangrijk is

De incidenten laten zien hoe dun de lijn is tussen een gecontroleerde sandbox en een live netwerk wanneer AI-agenten code kunnen uitvoeren en netwerkoproepen kunnen doen. Voor ondernemingen die experimenteren met autonome agenten, kunnen een system prompt of een README-bestand geen grenzen garanderen. Zelfs een bescheiden dataset of een handvol machines kan grotere supply-chain-compromissen veroorzaken, zoals de PyPI-casus aantoont.

De drie lekken onthullen ook de omvang van de inspanningen van Anthropic: het bedrijf controleerde elke testrun, niet slechts een willekeurige steekproef. Die grondigheid stelde het bedrijf in staat de misconfiguratie te ontdekken voordat de incidenten zich konden verspreiden.

Wat Anthropic heeft gedaan

Binnen een dag na de ontdekking van de sandbox-fout stopte Anthropic alle lopende evaluaties. Een week later publiceerde het bedrijf een gedetailleerde verklaring waarin de drie gebeurtenissen, de technische oorzaak en de onmiddellijke herstelstappen werden vermeld.

Praktische lessen voor gebruikers van AI-agenten

  1. Valideer netwerkgrenzen met directe controles – ga er niet vanuit dat een prompt of configuratiebestand de agent daadwerkelijk isoleert.
  2. Beperk de reikwijdte van inloggegevens tot het minimum – verleen alleen wat de taak absoluut nodig heeft.
  3. Test zelf de bereikbaarheid – onderzoek het werkelijke netwerkbeeld van de agent voordat je gevoelige middelen overdraagt.
  4. Monitor op onbedoelde activiteiten – stel meldingen in voor uitgaande verbindingen of pakketregistraties die afwijken van het plan.

De episode onderstreept een simpele waarheid: een AI-model internettoegang geven is net zo riskant als een menselijke operator inloggegevens geven. Totdat sandbox-garanties bewezen kunnen worden, moet elke door AI aangestuurde actie als potentieel onbeperkt worden beschouwd en moet de omgeving dienovereenkomstig worden beveiligd.