Anthropic en OpenAI hebben elk een nieuw onderzoekstraject geopend waarmee gescreende beveiligingsteams kunnen werken met AI-modellen waarvan de meeste veiligheidsfilters zijn verwijderd. Anthropic’s “Cyber Verification Program” en OpenAI’s “Trusted Access for Cyber” geven goedgekeurde onderzoekers directe toegang tot krachtige taalmodellen die onbeperkte code, prompts en instructies kunnen genereren. Deze stap is belangrijk omdat het een duidelijke splitsing in de AI-toeleveringsketen creëert: een handvol insiders kan de zwakste versies onderzoeken, terwijl de rest van de wereld achter sterkere beveiligingsmaatregelen blijft.
Waarom de programma's zijn gelanceerd
Beide bedrijven stellen dat de initiatieven tot doel hebben de ontdekking van kwetsbaarheden te versnellen die tegen hun diensten ingezet kunnen worden. Door een gecontroleerde groep experts een sandbox met minder beperkingen te bieden, hopen ze aanvalsvectoren aan het licht te brengen voordat kwaadwillende actoren dat doen. De aanpak weerspiegelt traditionele softwarebeveiliging, waarbij ontwikkelaars “bug-bounty”-versies vrijgeven aan een select publiek.
Nieuwe risicocalculatie voor verdedigers
De keerzijde is een toegangmodel met twee niveaus dat elke organisatie dwingt een lijn te trekken tussen “onderzoeker” en “hacker.” Die lijn wordt nu een potentieel aanvalsoppervlak. Als een aanvaller inloggegevens steelt, misbruik maakt van de toegang van een insider of het screeningproces omzeilt, kunnen ze de beveiligingsmaatregelen passeren die de meeste gebruikers beschermen. Eenmaal binnen kan het onbeperkte model worden aangezet tot:
- Het genereren van phishing-scripts die detectie omzeilen
- Het maken van zero-day exploits met gedetailleerde codesnippets
- Het produceren van overtuigende social-engineering prompts die zijn afgestemd op specifieke doelwitten
Beveiligingsteams die hun verdediging hebben opgebouwd op de aanname dat AI-outputs altijd gefilterd zijn, moeten dit uitgangspunt heroverwegen.
Hoe verdedigers kunnen reageren
- Beschouw de programma's als een bedreigingsvector. Ga ervan uit dat tegenstanders zullen proberen het screeningproces te infiltreren en monitor op abnormale inlogpatronen op AI-platforms.
- Breid detectie uit voorbij de cloud. Zoek naar door AI gegenereerde code of tekst in uitgaand verkeer, vooral vanuit bevoorrechte accounts.
- Veranker beleidskaders direct in de systemen. Handhaaf strikte “least-privilege”-regels voor elk intern gebruik van externe AI-diensten en segmenteer omgevingen die bereikbaar kunnen zijn via gecompromitteerde inloggegevens.
- Werk samen met de leveranciers. Blijf in contact met de beveiligingskanalen van Anthropic en OpenAI om waarschuwingen te ontvangen over wijzigingen in de toegangscriteria of ontdekt misbruik.
Het tegenargument
Voorstanders argumenteren dat zonder een veilig kanaal voor diepgaand onderzoek, kwetsbaarheden verborgen zullen blijven totdat ze in de praktijk worden misbruikt. De programma's zouden daarom het totale aanvalsoppervlak kunnen verkleinen door gebreken vroegtijdig aan het licht te brengen. Het nadeel is dat een “minder beveiligd” niveau opportunistisch misbruik uitlokt.
Waar op te letten
- Updates van het screeningproces door een van beide bedrijven
- Rapporten over misbruik voortvloeiend uit de programma's
- Sectorbrede verschuivingen in de manier waarop AI-gerelateerde aanvalsoppervlakken worden gecatalogiseerd
De kern van het verhaal: de nieuwe onderzoekstrajecten geven beveiligingsonderzoekers krachtige instrumenten, maar ze geven diezelfde instrumenten ook in handen van iedereen die de poort kan passeren. Defensieve teams moeten de programma's zowel beschouwen als een bron van inzicht als een nieuwe weg voor aanvallen.
