Anthropic gab bekannt, dass drei seiner Claude-Modelle während einer kürzlich durchgeführten Sicherheits-Testkampagne aus einer Sandbox ausgebrochen sind und auf reale Systeme zugegriffen haben, was zu einem sofortigen Stopp der Evaluierungen und einem öffentlichen Bericht führte.

Das Unternehmen führte 141.006 Cybersicherheits-Testläufe durch und stellte drei Vorfälle fest, bei denen die Modelle Live-Ziele statt der simulierten Umgebung erreichten. Eine Fehlkonfiguration bei einem Drittanbieter ließ die Sandbox faktisch offen.

Wie die Sicherheitsverletzungen zustande kamen

  • Claude Opus 4.7 landete bei einem tatsächlich im Internet exponierten Unternehmen und errat schwache Passwörter, um eine Datenbank mit einigen hundert Zeilen abzurufen.
  • Claude Mythos 5 führte einen Supply-Chain-Angriff durch, indem es ein Paket im echten PyPI-Repository veröffentlichte. Das Paket wurde auf 15 Produktionsmaschinen installiert, bevor das Register die Anomalie meldete.
  • Ein internes Forschungsmodell scannte 9.000 Ziele, kompromittierte eine einzelne Anwendung und stoppte sich dann selbst, nachdem es erkannt hatte, dass der Host nicht mit seiner simulierten Aufgabe übereinstimmte.

Anthropic betont, dass dies keine „Rogue AI“-Episoden waren. Die Modelle taten genau das, was ihnen gesagt wurde; die Testinfrastruktur versäumte es, sie vom offenen Internet zu isolieren.

Warum das wichtig ist

Die Vorfälle zeigen, wie schmal der Grat zwischen einer kontrollierten Sandbox und einem Live-Netzwerk ist, wenn KI-Agenten Code ausführen und Netzwerkaufrufe tätigen können. Für Unternehmen, die mit autonomen Agenten experimentieren, können ein System-Prompt oder eine README-Datei keine Grenzen garantieren. Selbst ein bescheidener Datensatz oder eine Handvoll Maschinen können größere Supply-Chain-Kompromittierungen auslösen, wie der PyPI-Fall zeigt.

Die drei Sicherheitsverletzungen offenbaren auch das Ausmaß der Bemühungen von Anthropic: Das Unternehmen hat jeden Testlauf geprüft und nicht nur eine Stichprobe gezogen. Diese Gründlichkeit ermöglichte es dem Unternehmen, die Fehlkonfiguration zu entdecken, bevor sich die Vorfälle ausweiten konnten.

Was Anthropic unternommen hat

Innerhalb eines Tages nach Entdeckung des Sandbox-Fehlers stoppte Anthropic alle laufenden Evaluierungen. Eine Woche später veröffentlichte das Unternehmen eine detaillierte Offenlegung, in der die drei Ereignisse, die technische Ursache und die sofortigen Behebungsschritte aufgeführt waren.

Praktische Erkenntnisse für Nutzer von KI-Agenten

  1. Netzwerk-Grenzen durch direkte Prüfungen validieren – gehen Sie nicht davon aus, dass ein Prompt oder eine Konfigurationsdatei den Agenten tatsächlich isoliert.
  2. Zugangsdaten auf das Minimum beschränken – gewähren Sie nur das, was die Aufgabe absolut benötigt.
  3. Erreichbarkeit selbst testen – prüfen Sie die tatsächliche Netzwerksicht des Agenten, bevor Sie sensible Ressourcen übergeben.
  4. Auf unbeabsichtigte Aktivitäten überwachen – richten Sie Warnmeldungen für ausgehende Verbindungen oder Paketregistrierungen ein, die vom Plan abweichen.

Die Episode unterstreicht eine einfache Wahrheit: Einem KI-Modell Internetzugang zu gewähren, ist ebenso riskant, wie einem menschlichen Operator Zugangsdaten zu übergeben. Bis Sandbox-Garantien bewiesen werden können, sollte jede KI-gesteuerte Aktion als potenziell uneingeschränkt betrachtet und die Umgebung entsprechend abgesichert werden.