Anthropic und OpenAI haben jeweils einen neuen Forschungspfad eröffnet, der es geprüften Sicherheitsteams ermöglicht, mit KI-Modellen zu arbeiten, denen die meisten Sicherheitsfilter entfernt wurden. Anthropics „Cyber Verification Program“ und OpenAIs „Trusted Access for Cyber“ bieten zugelassenen Forschern direkten Zugang zu leistungsstarken Sprachmodellen, die uneingeschränkten Code, Prompts und Anweisungen generieren können. Dieser Schritt ist von Bedeutung, da er eine klare Spaltung in der KI-Lieferkette schafft: Eine Handvoll Insider kann die schwächsten Versionen untersuchen, während der Rest der Welt hinter stärkeren Schutzmechanismen bleibt.
Warum die Programme entstanden sind
Beide Unternehmen geben an, dass die Initiativen darauf abzielen, die Entdeckung von Schwachstellen zu beschleunigen, die gegen ihre Dienste eingesetzt werden könnten. Indem sie einer kontrollierten Gruppe von Experten eine Sandbox mit weniger Einschränkungen zur Verfügung stellen, hoffen sie, Angriffsvektoren aufzudecken, bevor böswillige Akteure sie finden. Der Ansatz spiegelt die traditionelle Software-Sicherheit wider, bei der Entwickler „Bug-Bounty“-Builds an ein ausgewähltes Publikum freigeben.
Neue Risikokalkulation für Verteidiger
Die Kehrseite ist ein Zwei-Stufen-Zugangsmodell, das jede Organisation dazu zwingt, eine Grenze zwischen „Forscher“ und „Hacker“ zu ziehen. Diese Grenze wird nun zu einer potenziellen Angriffsfläche. Wenn ein Angreifer Zugangsdaten stiehlt, den Zugriff eines Insiders ausnutzt oder den Prüfprozess überlistet, kann er die Schutzmechanismen umgehen, die die meisten Nutzer schützen. Einmal im System, kann das uneingeschränkte Modell dazu gebracht werden:
- Phishing-Skripte zu generieren, die der Erkennung entgehen
- Zero-Day-Exploits mit detaillierten Code-Snippets zu erstellen
- Überzeugende Social-Engineering-Prompts zu produzieren, die auf spezifische Ziele zugeschnitten sind
Sicherheitsteams, die ihre Abwehrmaßnahmen auf der Annahme aufgebaut haben, dass KI-Ausgaben immer gefiltert werden, müssen diese Prämisse überdenken.
Wie Verteidiger reagieren können
- Betrachten Sie die Programme als Bedrohungsvektor. Gehen Sie davon aus, dass Angreifer versuchen werden, die Prüf-Pipeline zu infiltrieren, und überwachen Sie Plattformen auf ungewöhnliche Login-Muster.
- Erweitern Sie die Erkennung über die Cloud hinaus. Suchen Sie nach KI-generiertem Code oder Text im ausgehenden Datenverkehr, insbesondere bei privilegierten Konten.
- Implementieren Sie strikte Richtlinienkontrollen. Erzwingen Sie strenge „Least-Privilege“-Regeln für jede interne Nutzung externer KI-Dienste und segmentieren Sie Umgebungen, die über kompromittierte Zugangsdaten erreichbar sein könnten.
- Arbeiten Sie mit den Anbietern zusammen. Bleiben Sie über die Sicherheits-Kontaktkanäle von Anthropic und OpenAI informiert, um Warnungen über Änderungen der Zugangskriterien oder entdeckten Missbrauch zu erhalten.
Der Gegenpunkt
Befürworter argumentieren, dass Schwachstellen verborgen bleiben, bis sie in der Praxis ausgenutzt werden, wenn es keinen sicheren Kanal für tiefgehende Untersuchungen gibt. Die Programme könnten daher die gesamte Angriffsfläche verringern, indem sie Mängel frühzeitig aufdecken. Der Kompromiss besteht darin, dass eine „weniger geschützte“ Ebene opportunistischen Missbrauch einlädt.
Worauf zu achten ist
- Updates zum Prüfprozess der jeweiligen Unternehmen
- Berichte über Missbrauch im Zusammenhang mit den Programmen
- Branchenweite Veränderungen in der Katalogisierung von KI-bezogenen Angriffsflächen
Das Fazit: Die neuen Forschungspfade geben Sicherheitsforschern mächtige Werkzeuge an die Hand, aber sie geben dieselben Werkzeuge auch jedem, der es schafft, das Tor zu passieren. Verteidigungsteams müssen die Programme sowohl als Quelle für Erkenntnisse als auch als neuen Angriffsweg betrachten.
