A new open-source scanner that audits AI “agent skills” is being turned into a tool after researchers showed an unverified skill can silently harvest SSH keys and cloud credentials. The scanner blends keyword filters, behavior analysis, AI-driven reasoning, sandbox execution and change-detection to stop the next wave of supply-chain attacks against AI-assisted developers.

Dlaczego umiejętności AI są teraz istotne

Asystenci oparci na dużych modelach językowych (LLM), tacy jak Claude i GitHub Copilot, polegają obecnie na „umiejętnościach agentów” (agent skills) – małych, samodzielnych folderach, które instruują model, jak wykonać konkretne zadanie. GitHub niedawno dodał jednolinijkową komendę, która pozwala programistom pobierać te umiejętności bezpośrednio z publicznych repozytoriów, co czyni z nich de facto menedżer pakietów dla przepływów pracy napędzanych przez AI.

Wygoda jest niezaprzeczalna: umiejętność może przekształcić ogólne polecenie, takie jak „wyczyść ten arkusz kalkulacyjny”, w precyzyjne wywołania API, manipulacje plikami lub edycję kodu. Ta sama prostota pozwala na przemycenie złośliwego kodu do pakietu.

Strona ostrzegawcza GitHub zauważa, że umiejętności nie są weryfikowane przed instalacją.

Jak ukryty ładunek może pozostać niezauważony

W przeciwieństwie do typowego pliku binarnego, umiejętność AI nie ładuje się naraz. Model najpierw czyta krótki opis, a następnie pobiera pełny zestaw instrukcji dopiero wtedy, gdy zadanie wydaje się istotne. To etapowe ładowanie tworzy okno czasowe, w którym złośliwy plik może pozostawać nieaktywny i niewidoczny dla użytkownika, dopóki model nie zdecyduje się go wywołać.

W eksperymencie typu proof-of-concept badacz stworzył fałszywą umiejętność o nazwie csv-formatter, która reklamowała czyszczenie arkuszy kalkulacyjnych. Widoczny kod wyglądał nieszkodliwie, ale ukryta instrukcja dodawała „krok diagnostyczny”. Krok ten nie służył do diagnostyki; skanował on system gospodarza w poszukiwaniu prywatnych kluczy SSH i tokenów dostępu AWS, a następnie wysyłał wyniki na zewnętrzny serwer.

Złośliwa komenda pojawiła się również w pliku changelog – miejscu, którego większość ludzi nigdy nie sprawdza, ale które AI czyta podczas analizy historii wersji. AI po cichu wykonało procedurę kradzieży poświadczeń, podczas gdy programista myślał, że umiejętność służy jedynie formatowaniu danych.

Odpowiedź open-source

Aby wypełnić tę lukę, badacz zapakował logikę wykrywania do narzędzia audytowego open-source. Skaner nie polega na jednej technice; nakłada on na siebie kilka warstw obrony:

  • Dopasowywanie słów kluczowych wyłapuje oczywiste, niechlujne próby zawierające znane złośliwe ciągi znaków.
  • Analiza zachowań flaguje instrukcje, które odczytują pliki poświadczeń, a następnie wykonują połączenia sieciowe.
  • Wnioskowanie AI uruchamia model pomocniczy, aby ocenić, czy instrukcje umiejętności są celowo ukrywane przed użytkownikiem.
  • Sandboxing (uruchamianie w piaskownicy) wykonuje umiejętność w odizolowanym środowisku, obserwując działania w czasie rzeczywistym bez ryzyka dla systemu gospodarza.
  • Wykrywanie zmian monitoruje zaufane umiejętności pod kątem nieoczekiwanych modyfikacji, ostrzegając opiekunów przed instalacją nowej wersji.

Autor dołączy zestaw testowy, który reprodukuje atak csv-formatter, oraz publiczny benchmark mierzący wskaźniki wykrywalności na wyselekcjonowanym zestawie bezpiecznych i złośliwych umiejętności.

Na co zwrócić uwagę w przyszłości

  • Benchmarki społecznościowe: W miarę jak coraz więcej badaczy będzie publikować próbki złośliwych umiejętności, publiczny benchmark będzie wymagał regularnych aktualizacji, aby pozostać aktualnym.

Pojawienie się umiejętności agentów AI wyznacza nową granicę w narzędziach dla programistów, ale otwiera również drzwi dla ataków na łańcuch dostaw, które omijają tradycyjne przeglądy kodu. Skaner open-source, który łączy statyczne kontrole, dynamiczną obserwację i wnioskowanie AI, oferuje praktyczną pierwszą linię obrony. Programiści, którzy będą traktować umiejętność jak przypadkowy pendrive, wkrótce przekonają się, że koszt ignorowania weryfikacji znacznie przewyższa wygodę natychmiastowej pomocy AI.