Un nuovo scanner open-source che esamina le "agent skills" dell'IA sta diventando uno strumento operativo dopo che dei ricercatori hanno dimostrato che una skill non verificata può sottrarre silenziosamente chiavi SSH e credenziali cloud. Lo scanner combina filtri per parole chiave, analisi del comportamento, ragionamento basato sull'IA, esecuzione in sandbox e rilevamento delle modifiche per fermare la prossima ondata di attacchi alla supply chain contro gli sviluppatori assistiti dall'IA.

Perché le skill dell'IA sono importanti ora

Gli assistenti basati su modelli linguistici di grandi dimensioni (LLM), come Claude e GitHub Copilot, si affidano ora alle "agent skills": piccole cartelle autonome che indicano al modello come eseguire un compito specifico. GitHub ha recentemente aggiunto un comando di una sola riga che consente agli sviluppatori di scaricare queste skill direttamente dai repository pubblici, trasformandole di fatto in un gestore di pacchetti per i flussi di lavoro guidati dall'IA.

La comodità è innegabile: una skill può trasformare una richiesta vaga come "pulisci questo foglio di calcolo" in precise chiamate API, manipolazioni di file o modifiche al codice. La stessa semplicità permette al codice malevolo di infiltrarsi nel pacchetto.

La pagina di avviso di GitHub segnala che le skill non vengono verificate prima dell'installazione.

Come un payload nascosto può passare inosservato

A differenza di un tipico binario, una skill dell'IA non viene caricata tutta in una volta. Il modello legge prima un breve riassunto, quindi recupera l'intero set di istruzioni solo quando il compito appare pertinente. Questo caricamento a stadi crea una finestra temporale in cui un file malevolo può rimanere inattivo, invisibile all'utente, finché il modello non decide di invocarlo.

In un esperimento di prova di concetto (proof-of-concept), il ricercatore ha creato una falsa skill chiamata csv-formatter che prometteva la pulizia di fogli di calcolo. Il codice visibile sembrava innocuo, ma un'istruzione nascosta aggiungeva un "passaggio diagnostico". Il passaggio non diagnosticava nulla; scansionava l'host alla ricerca di chiavi private SSH e token di accesso AWS, per poi inviare i risultati a un server esterno.

Il comando malevolo appariva anche in un file di changelog, un punto che la maggior parte degli esseri umani non controlla mai, ma che l'IA legge quando valuta la cronologia delle versioni. L'IA ha eseguito silenziosamente una routine di furto di credenziali mentre lo sviluppatore pensava che la skill stesse semplicemente formattando i dati.

La risposta open-source

Per colmare la lacuna, il ricercatore ha impacchettato la logica di rilevamento in uno strumento di auditing open-source. Lo scanner non si affida a una singola tecnica, ma stratifica diverse difese:

  • Il confronto per parole chiave intercetta i tentativi ovvi e pigri che includono stringhe malevole note.
  • L'analisi del comportamento segnala le istruzioni che leggono file di credenziali e successivamente effettuano chiamate di rete.
  • Il ragionamento dell'IA esegue un modello secondario per valutare se le istruzioni di una skill siano deliberatamente nascoste all'utente.
  • Il sandboxing esegue la skill in un ambiente isolato, osservando le azioni in tempo reale senza rischiare il sistema host.
  • Il rilevamento delle modifiche monitora le skill affidabili per individuare modifiche inaspettate, avvisando i manutentori prima che venga installata una nuova versione.

L'autore includerà una suite di test che riproduce l'attacco csv-formatter e un benchmark pubblico che misura i tassi di rilevamento su un set selezionato di skill benigne e malevole.

Cosa osservare in futuro

  • Benchmark della community: Man mano che altri ricercatori pubblicano campioni di skill malevole, il benchmark pubblico dovrà ricevere aggiornamenti regolari per rimanere rilevante.

L'emergere delle agent skill dell'IA segna una nuova frontiera negli strumenti per sviluppatori, ma apre anche la porta ad attacchi alla supply chain che aggirano le tradizionali revisioni del codice. Uno scanner open-source che combina controlli statici, osservazione dinamica e ragionamento dell'IA offre una prima linea di difesa pratica. Gli sviluppatori che trattano una skill come una chiavetta USB qualsiasi scopriranno presto che il costo dell'ignorare la verifica supera di gran lunga la comodità dell'assistenza istantanea dell'IA.