OpenAI hat heute GPT-Red veröffentlicht, ein Large Language Model, das als automatisierter Red-Team-Hacker fungiert. Das System härtet bereits das neueste GPT-5.6-Modell des Unternehmens, wodurch die Erfolgsquote simulierter Angriffe von über 90 % auf unter 23 % gesenkt wurde.
Wie GPT-Red die Red-Team-Arbeit automatisiert
Red-Team-Tests – der bewusste Versuch, ein System zu brechen oder zu kapern – haben sich traditionell auf Sicherheitsexperten verlassen. Da LLMs lernen, im Web zu surfen, Code auszuführen und Dienste von Drittanbietern aufzurufen, vervielfachen sich die Möglichkeiten ihres Missbrauchs schneller, als ein menschliches Team sie erforschen kann.
OpenAI reagierte mit einer „Self-Play-Schleife“, bei der eine Kopie eines Modells in einer simulierten Umgebung, die die Forscher „Dojo“ nennen, gegen eine andere Kopie antritt. In dieser Sandbox übernimmt GPT-Red die Rolle des Angreifers, während ein oder mehrere Verteidiger-Modelle versuchen, Widerstand zu leisten. Die beiden Seiten absolvieren unzählige Runden; jede Iteration zwingt den Angreifer dazu, subtilere Schwachstellen aufzudecken, und den Verteidiger, neue Abwehrmechanismen zu erlernen. OpenAI hat diesen Prozess in die Trainings-Pipeline integriert, mit der GPT-5.6 erstellt wurde – ein Modell, das das Unternehmen als seine bisher robusteste Veröffentlichung anpreist.
Eine neue Klasse von Angriffen: die gefälschte Chain of Thought
Die Self-Play-Durchläufe deckten einen auffälligen „Fake Chain of Thought“-Angriff auf. LLMs geben oft eine schrittweise Begründung aus – eine „Chain of Thought“ –, die zur endgültigen Antwort führt. GPT-Red hat gelernt, falsche Einträge in diesen Pfad einzufügen, sodass das Modell glaubt, bereits falsche Prämissen verifiziert zu haben. Beispielsweise kann der Angreifer das Modell davon überzeugen, dass „1 + 1 = 3“ bereits überprüft wurde, was das System dazu veranlasst, Ausgaben auf Basis des erfundenen Ergebnisses zu generieren.
Der Angriff beschränkt sich nicht nur auf reine Textgeneratoren. In einem Test gegen „Vendy“, einen von einem externen Labor entwickelten Agenten im Stil eines Verkaufsautomaten, manipulierte GPT-Red Preisfelder und stornierte Bestellungen, was beweist, dass die Technik auch gegen spezialisierte Agenten funktioniert, die auf Benutzerbefehle reagieren.
Messbare Sicherheitssteigerung
OpenAI veröffentlichte Zahlen, die die Auswirkungen des Trainings gegen GPT-Red zeigen. Als die stärksten, vom neuen Modell generierten Angriffe gegen die im August veröffentlichte GPT-5 durchgeführt wurden, waren mehr als 90 % erfolgreich. Dieselben Angriffe gegen GPT-5.6 waren in weniger als 23 % der Fälle erfolgreich.
In einem Experiment aus dem Jahr 2025, bei dem GPT-Red gegen menschliche Red-Teamer antrat, entdeckte und verfeinerte die KI Angriffsvariationen effizienter als die Menschen. Dies deutet darauf hin, dass ein adversariales Modell einen größeren Teil des Schwachstellenraums in kürzerer Zeit erkunden kann.
Grenzen und der anhaltende Bedarf an menschlicher Expertise
GPT-Red ersetzt keine menschlichen Sicherheitsanalysten. Es stolpert immer noch über mehrstufige Konversationsangriffe, bei denen der Angreifer über mehrere Interaktionen hinweg eine Erzählung aufbaut, sowie über visuelle Prompt-Injektionen, die bösartigen Text in Bildern verstecken. OpenAI plant, das Modell als erste Erkundungsebene einzusetzen, um vielversprechende Angriffsideen aufzuzeigen, die menschliche Experten dann untersuchen und weiterentwickeln können.
Das Tool bleibt proprietär, sodass externe Forscher seine Fähigkeiten nicht direkt testen oder die gemeldeten Fortschritte verifizieren können.
