Ein neuer Open-Source-Scanner, der KI-„Agent Skills“ prüft, wird zu einem Werkzeug ausgebaut, nachdem Forscher zeigten, dass ein nicht verifizierter Skill heimlich SSH-Keys und Cloud-Anmeldedaten stehlen kann. Der Scanner kombiniert Keyword-Filter, Verhaltensanalyse, KI-basiertes Reasoning, Sandbox-Ausführung und Änderungsprüfung, um die nächste Welle von Supply-Chain-Angriffen gegen KI-unterstützte Entwickler zu stoppen.

Warum KI-Skills jetzt wichtig sind

Large-Language-Model (LLM)-Assistenten wie Claude und GitHub Copilot verlassen sich mittlerweile auf „Agent Skills“ – kleine, in sich geschlossene Ordner, die dem Modell mitteilen, wie eine bestimmte Aufgabe auszuführen ist. GitHub hat kürzlich einen Einzeiler-Befehl hinzugefügt, mit dem Entwickler diese Skills direkt aus öffentlichen Repositories abrufen können, was sie zu einem de-facto Paketmanager für KI-gesteuerte Workflows macht.

Der Komfort ist unbestreitbar: Ein Skill kann eine vage Anfrage wie „Bereinige diese Tabelle“ in präzise API-Aufrufe, Dateimanipulationen oder Code-Änderungen umwandeln. Dieselbe Einfachheit ermöglicht es jedoch, bösartigen Code in das Paket einzuschleusen.

Auf der Warnseite von GitHub wird darauf hingewiesen, dass Skills vor der Installation nicht verifiziert werden.

Wie ein versteckter Payload unter dem Radar bleiben kann

Im Gegensatz zu einer typischen Binärdatei wird ein KI-Skill nicht auf einmal geladen. Das Modell liest zuerst eine kurze Zusammenfassung und ruft den vollständigen Befehlssatz erst ab, wenn die Aufgabe relevant erscheint. Dieses gestaffelte Laden schafft ein Zeitfenster, in dem eine bösartige Datei unauffällig und für den Benutzer unsichtbar verharren kann, bis das Modell beschließt, sie aufzurufen.

In einem Proof-of-Concept-Experiment erstellte der Forscher einen gefälschten Skill namens csv-formatter, der die Bereinigung von Tabellenkalkulationen versprach. Der sichtbare Code wirkte harmlos, aber eine versteckte Anweisung fügte einen „Diagnoseschritt“ hinzu. Dieser Schritt diagnostizierte nichts; er scannte den Host nach SSH-Privatschlüsseln und AWS-Access-Tokens und übermittelte die Ergebnisse an einen externen Server.

Der bösartige Befehl tauchte auch in einer Changelog-Datei auf – eine Stelle, die die meisten Menschen nie prüfen, die die KI jedoch liest, wenn sie die Versionshistorie auswertet. Die KI führte im Stillen eine Routine zum Diebstahl von Anmeldedaten aus, während der Entwickler glaubte, der Skill würde lediglich Daten formatieren.

Die Open-Source-Reaktion

Um diese Lücke zu schließen, hat der Forscher die Erkennungslogik in ein Open-Source-Auditing-Tool verpackt. Der Scanner verlässt sich nicht auf eine einzige Technik, sondern setzt auf mehrere Verteidigungsebenen:

  • Keyword-Matching erkennt offensichtliche, ungeschickte Versuche, die bekannte bösartige Zeichenfolgen enthalten.
  • Verhaltensanalyse markiert Anweisungen, die Anmeldedaten-Dateien lesen und anschließend Netzwerkaufrufe tätigen.
  • KI-Reasoning nutzt ein sekundäres Modell, um zu bewerten, ob die Anweisungen eines Skills absichtlich vor dem Benutzer verborgen werden.
  • Sandboxing führt den Skill in einer isolierten Umgebung aus und beobachtet die Aktionen in Echtzeit, ohne das Host-System zu gefährden.
  • Änderungserkennung überwacht vertrauenswürdige Skills auf unerwartete Modifikationen und alarmiert die Maintainer, bevor eine neue Version installiert wird.

Der Autor wird eine Testsuite bereitstellen, die den csv-formatter-Angriff reproduziert, sowie einen öffentlichen Benchmark, der die Erkennungsraten anhand einer kuratierten Auswahl harmloser und bösartiger Skills misst.

Worauf man als Nächstes achten sollte

  • Community-Benchmarks: Da immer mehr Forscher Proben bösartiger Skills veröffentlichen, wird der öffentliche Benchmark regelmäßige Aktualisierungen benötigen, um relevant zu bleiben.

Das Aufkommen von KI-Agent-Skills markiert eine neue Grenze in der Entwicklung von Developer-Tools, öffnet aber auch die Tür für Supply-Chain-Angriffe, die herkömmliche Code-Reviews umgehen. Ein Open-Source-Scanner, der statische Prüfungen, dynamische Beobachtung und KI-Reasoning kombiniert, bietet eine praktische erste Verteidigungslinie. Entwickler, die einen Skill wie einen wahllosen USB-Stick behandeln, werden bald feststellen, dass die Kosten für das Ignorieren der Verifizierung den Komfort einer sofortigen KI-Unterstützung bei weitem übersteigen.