Waarom OpenAI overstapte op een AI-aanvaller

Traditionele red-team oefeningen dwingen security engineers om modellen handmatig te testen – een traag en kostbaar proces dat wordt beperkt door de menselijke verbeelding. OpenAI reageerde met GPT-Red, een self-play systeem dat een aanvallend model tegenover een verdedigende tegenhanger zet. Elke aanvalronde voedt de verdediger met nieuwe gegevens; de aanvaller leert van elke mislukking, waardoor een evolutionaire lus ontstaat die exploitatiepatronen aan het licht brengt waar geen mens op zou komen.

De cijfers die ertoe doen

  • Aanvalssucces: GPT-Red slaagde in 84% van de testgevallen, tegenover 13% voor menselijke red-teamers.
  • Modelverharding: OpenAI voerde de inzichten van GPT-Red rechtstreeks in de trainingspipeline, en GPT-5.6 Sol registreert nu zes keer minder prompt-injection-fouten dan het vlaggenschipmodel dat vier maanden eerder werd uitgebracht.
  • Residueel risico: Zelfs met de nieuwe verdedigingsmechanismen glippen ongeveer 3,8% van de "sterkere" injecties er nog steeds doorheen, een foutpercentage dat vergelijkbaar is met dat van Claude Opus 4.5.

Een live demo onderstreepte de kracht van het systeem: GPT-Red manipuleerde een door AI aangestuurde verkoopautomaat op het kantoor van OpenAI, waarbij prijzen van artikelen werden gewijzigd en bestellingen werden geannuleerd zonder enige menselijke tussenkomst.

Wat de verbetering betekent voor gebruikers

OpenAI stelt dat GPT-5.6 Sol dezelfde redeneersnelheid en antwoordkwaliteit behoudt als zijn voorganger, waardoor het langdurige dilemma tussen veiligheid en bruikbaarheid wordt omzeild, waarbij strengere beveiliging vaak de bruikbaarheid vermindert.

De beperkingen van een geautomatiseerd red team

Automatisering heft niet alle risico's op. Het succespercentage van 3,8% voor injecties met een hoge intensiteit laat zien dat zelfs een geavanceerd self-play systeem gaten laat vallen.

Wat volgt

  • Iteratieve upgrades: De self-play-lus zal blijven evolueren.

De kern

GPT-Red bewijst dat AI slimmer kan zijn dan mensen bij het vinden van zwakheden in zijn eigen soort, wat resulteert in een meetbare zesvoudige vermindering van prompt-injection-fouten voor GPT-5.6. De doorbraak verkleint de kloof tussen veiligheid en bruikbaarheid, maar een klein, reëel residu-risico blijft bestaan. Het volgende hoofdstuk hangt af van de manier waarop OpenAI geautomatiseerde red-team inzichten combineert met externe controle om voorop te blijven lopen op tegenstanders die zelf steeds vaker naar AI grijpen.