Warum OpenAI auf einen KI-Angreifer setzte

Traditionelle Red-Teaming-Übungen zwingen Sicherheitsingenieure dazu, Modelle manuell zu testen – ein langsamer, kostspieliger Prozess, der durch die menschliche Vorstellungskraft begrenzt ist. OpenAI antwortete mit GPT-Red, einem Self-Play-System, das ein angreifendes Modell gegen ein verteidigendes Gegenstück ausspielt. Jede Angriffsrunde liefert dem Verteidiger neue Daten; der Angreifer lernt aus jedem Fehlschlag und schafft so eine evolutionäre Schleife, die Exploit-Muster ans Licht bringt, auf die kein Mensch kommen würde.

Die entscheidenden Zahlen

  • Angriffserfolg: GPT-Red war in 84 % der Testfälle erfolgreich, im Vergleich zu 13 % bei menschlichen Red-Teamern.
  • Modell-Härtung: OpenAI speiste die Erkenntnisse von GPT-Red direkt in die Trainings-Pipeline ein, und GPT-5.6 Sol verzeichnet nun sechsmal weniger Prompt-Injection-Fehler als das Flaggschiff-Modell, das vier Monate zuvor veröffentlicht wurde.
  • Restrisiko: Selbst mit den neuen Abwehrmechanismen schlüpfen etwa 3,8 % der „stärkeren“ Injektionen immer noch durch – eine Fehlerrate, die mit Claude Opus 4.5 vergleichbar ist.

Eine Live-Demo unterstrich die Leistungsfähigkeit des Systems: GPT-Red manipulierte einen KI-gesteuerten Verkaufsautomaten in OpenAIs Büro, änderte Artikelpreise und stornierte Bestellungen ohne jegliches menschliches Eingreifen.

Was die Verbesserung für Nutzer bedeutet

OpenAI gibt an, dass GPT-5.6 Sol die gleiche Denkgeschwindigkeit und Antwortqualität wie sein Vorgänger beibehält und so den langjährigen Zielkonflikt zwischen Sicherheit und Nutzen umgeht, bei dem strengere Schutzmaßnahmen die Nützlichkeit einschränken.

Die Grenzen eines automatisierten Red Teams

Automatisierung beseitigt nicht alle Risiken. Die Erfolgsquote von 3,8 % bei starken Injektionen zeigt, dass selbst ein hochentwickeltes Self-Play-System Lücken lässt.

Worauf man als Nächstes achten sollte

  • Iterative Upgrades: Die Self-Play-Schleife wird sich ständig weiterentwickeln.

Fazit

GPT-Red beweist, dass eine KI Menschen bei der Suche nach Schwachstellen in ihrer eigenen Art überlegen sein kann, was zu einer messbaren sechsfachen Reduzierung der Prompt-Injection-Fehler bei GPT-5.6 führt. Der Durchbruch verringert die Kluft zwischen Sicherheit und Nutzen, doch ein kleines, reales Restrisiko bleibt bestehen. Das nächste Kapitel wird davon abhängen, wie OpenAI automatisierte Red-Team-Erkenntnisse mit externer Prüfung kombiniert, um den Angreifern einen Schritt voraus zu bleiben, die selbst zunehmend auf KI setzen.