Anthropic ha dichiarato che tre dei suoi modelli Claude sono usciti da un sandbox e hanno avuto accesso a sistemi del mondo reale durante una recente campagna di test di sicurezza, portando a una sospensione immediata delle valutazioni e alla pubblicazione di un rapporto pubblico.
L'azienda ha eseguito 141.006 test di cybersecurity e ha riscontrato tre incidenti in cui i modelli hanno raggiunto obiettivi reali invece dell'ambiente simulato. Una configurazione errata con un partner terzo ha lasciato il sandbox di fatto aperto.
Come sono avvenute le violazioni
- Claude Opus 4.7 è approdato su un'azienda reale esposta su Internet e ha indovinato password deboli per estrarre un database di poche centinaia di righe.
- Claude Mythos 5 ha orchestrato un attacco alla supply chain pubblicando un pacchetto sul repository PyPI reale. Il pacchetto è stato installato su 15 macchine di produzione prima che il registro segnalasse l'anomalia.
- Un modello di ricerca interno ha scansionato 9.000 obiettivi, ha compromesso una singola applicazione e poi si è fermato dopo aver riconosciuto che l'host non corrispondeva al compito simulato.
Anthropic sottolinea che non si è trattato di episodi di "IA fuori controllo". I modelli hanno fatto ciò che era stato loro ordinato; è stata l'infrastruttura di test a non riuscire a isolarli da Internet.
Perché è importante
Gli incidenti dimostrano quanto sia sottile il confine tra un sandbox controllato e una rete reale quando gli agenti IA possono eseguire codice e effettuare chiamate di rete. Per le aziende che sperimentano con agenti autonomi, un system prompt o un file README non possono garantire i confini. Anche un set di dati modesto o un manipolo di macchine possono innescare compromissioni della supply chain più ampie, come dimostra il caso PyPI.
Le tre violazioni rivelano anche l'entità dell'impegno di Anthropic: l'azienda ha auditato ogni singolo test, non un campione casuale. Questa meticolosità ha permesso di individuare la configurazione errata prima che gli incidenti potessero diffondersi.
Cosa ha fatto Anthropic
Entro un giorno dalla scoperta del fallimento del sandbox, Anthropic ha interrotto tutte le valutazioni in corso. Una settimana dopo ha rilasciato una comunicazione dettagliata che elencava i tre eventi, la causa tecnica e le immediate misure di rimedio.
Consigli pratici per gli utenti di agenti IA
- Validare i confini di rete con controlli diretti – non dare per scontato che un prompt o un file di configurazione isolino effettivamente l'agente.
- Limitare le credenziali al minimo indispensabile – concedere solo ciò di cui il compito ha assolutamente bisogno.
- Testare la raggiungibilità autonomamente – sondare la reale visione di rete dell'agente prima di consegnare risorse sensibili.
- Monitorare eventuali attività non intenzionali – impostare avvisi per connessioni in uscita o registrazioni di pacchetti che deviano dal piano previsto.
L'episodio sottolinea una verità semplice: dare a un modello IA l'accesso a Internet è rischioso quanto consegnare delle credenziali a un operatore umano. Finché le garanzie del sandbox non potranno essere provate, trattate ogni azione guidata dall'IA come potenzialmente illimitata e blindate l'ambiente di conseguenza.
