Anthropic e OpenAI hanno ciascuna aperto un nuovo percorso di ricerca che consente a team di sicurezza accreditati di lavorare con modelli IA privati della maggior parte dei filtri di sicurezza. Il “Cyber Verification Program” di Anthropic e il “Trusted Access for Cyber” di OpenAI offrono ai ricercatori approvati un accesso diretto a potenti modelli linguistici in grado di generare codice, prompt e istruzioni senza restrizioni. La mossa è significativa perché crea una chiara biforcazione nella catena di approvvigionamento dell'IA: un manipolo di insider può sondare le versioni più deboli, mentre il resto del mondo rimane protetto da barriere più robuste.

Perché sono nati questi programmi

Entrambe le aziende affermano che le iniziative mirano ad accelerare la scoperta di vulnerabilità che potrebbero essere utilizzate come armi contro i loro servizi. Fornendo a un gruppo controllato di esperti una sandbox con meno restrizioni, sperano di far emergere vettori di attacco prima che gli attori malevoli li trovino. L'approccio rispecchia la sicurezza software tradizionale, in cui gli sviluppatori rilasciano build per il “bug-bounty” a un pubblico selezionato.

Un nuovo calcolo del rischio per i difensori

Il rovescio della medaglia è un modello di accesso a due livelli che costringe ogni organizzazione a tracciare una linea tra “ricercatore” e “hacker”. Quella linea diventa ora una potenziale superficie di attacco. Se un attaccante ruba le credenziali, sfrutta l'accesso di un insider o inganna il processo di accreditamento, può aggirare le barriere che proteggono la maggior parte degli utenti. Una volta all'interno, il modello senza restrizioni può essere indotto a:

  • Generare script di phishing che evitano il rilevamento
  • Creare exploit zero-day con snippet di codice dettagliati
  • Produrre prompt di social engineering convincenti, personalizzati per obiettivi specifici

I team di sicurezza che hanno costruito difese partendo dal presupposto che gli output dell'IA siano sempre filtrati devono ripensare tale premessa.

Come possono rispondere i difensori

  • Trattare i programmi come un vettore di minaccia. Presumere che gli avversari cercheranno di infiltrarsi nel processo di accreditamento e monitorare eventuali modelli di login anomali sulle piattaforme IA.
  • Espandere il rilevamento oltre il cloud. Cercare codice o testo generato dall'IA nel traffico in uscita, specialmente da account privilegiati.
  • Implementare controlli di policy rigidi. Applicare regole rigorose di “minimo privilegio” per qualsiasi uso interno di servizi IA esterni e segmentare gli ambienti che potrebbero essere raggiunti da una credenziale compromessa.
  • Collaborare con i fornitori. Rimanere in contatto con i canali di collegamento della sicurezza di Anthropic e OpenAI per ricevere avvisi su cambiamenti nei criteri di accesso o abusi scoperti.

Il punto di vista opposto

I sostenitori sostengono che, senza un canale sicuro per un'analisi approfondita, le vulnerabilità rimarranno nascoste finché non verranno sfruttate sul campo. Pertanto, i programmi potrebbero ridurre la superficie di attacco complessiva facendo emergere le falle precocemente. Il compromesso è che un livello “meno protetto” invita ad abusi opportunistici.

Cosa monitorare

  • Aggiornamenti al processo di accreditamento da parte di entrambe le aziende
  • Segnalazioni di utilizzi impropri derivanti dai programmi
  • Spostamenti a livello di settore nel modo in cui vengono catalogate le superfici di attacco legate all'IA

In sintesi: i nuovi percorsi di ricerca forniscono ai ricercatori di sicurezza strumenti potenti, ma consegnano gli stessi strumenti a chiunque riesca a superare il varco. I team di difesa devono considerare i programmi sia come una fonte di approfondimento sia come un nuovo canale di attacco.