Immagina di essere un senior application security engineer in una società di servizi finanziari. Inserisci un frammento di codice di autenticazione sviluppato internamente in un modello AI all'avanguardia e gli chiedi di identificare falle logiche. Invece di un'analisi, ricevi una lezione. Il modello si rifiuta con la motivazione che potresti usare le informazioni per "sfruttare un sistema". Non sei un criminale. Sei la persona assunta per fermare i criminali. Eppure, il guardrail tratta entrambi i ruoli come indistinguibili.

Questo scenario sta diventando routine. Mentre i grandi laboratori di IA inaspriscono i protocolli di sicurezza per prevenire usi impropri e malevoli, essi si scontrano frontalmente con i flussi di lavoro dei professionisti legittimi della cybersecurity. Il risultato è un paradosso crescente: gli stessi strumenti promossi come moltiplicatori di forza per l'ingegneria del software vengono negati agli specialisti che proteggono le infrastrutture critiche.

L'attrito tra Safety e Security

I principali sviluppatori di IA non hanno ignorato completamente la comunità della cybersecurity. OpenAI gestisce un programma chiamato Trusted Access for Cyber. Anthropic opera un Cyber Verification Program. Entrambi sono progettati per consentire agli utenti verificati di bypassare certi meccanismi di rifiuto, in modo da poter condurre ricerche legittime. In teoria, questi cancelli separano i buoni attori dai cattivi.

In pratica, molti ricercatori di sicurezza offensiva e difensori di rete li percepiscono come ostacoli burocratici. I processi di verifica possono essere opachi. Le tempistiche di approvazione non sono chiare. Anche dopo l'accettazione, i ricercatori riferiscono che l'accesso elevato non sempre funziona in modo affidabile tra diverse versioni del modello o thread di conversazione. Per i team che corrono per patchare vulnerabilità sotto attacco attivo, questo attrito è determinante.

La tensione tra Washington e la Silicon Valley ha raggiunto un punto di rottura significativo quando il governo degli Stati Uniti ha imposto controlli sulle esportazioni sui modelli Mythos e Fable di Anthropic. Le restrizioni sono seguite a rapporti secondo cui alcuni individui avevano aggirato i guardrail di sicurezza dei modelli per facilitare attacchi informatici. I regolatori si sono mossi rapidamente per trattare questi sistemi come merci da esportazione unicamente pericolose. Da allora, i controlli sono stati revocati o modificati, ma l'episodio ha inviato un segnale chiaro: i modelli di IA ad alta capacità sono sempre più visti come potenziali dispositivi apocalittici piuttosto che come strumenti tecnici di uso generale. Per i difensori che fanno affidamento su di essi, questa percezione si traduce in uno scrutinio più severo, un accesso più lento e un sospetto sottostante che la ricerca sulla sicurezza sia solo hacking con un altro nome.

Perché difesa e offesa sono inseparabili

Il cuore del conflitto non è amministrativo. È tecnico. Le stesse capacità necessarie per difendere una rete sono quasi identiche a quelle necessarie per attaccarla.

Chris Anley, Chief Scientist presso NCC Group, usa una semplice analogia: l'IA è un martello. Puoi usarlo per costruire una casa o per rompere una finestra. Lo strumento in sé non conosce la differenza. Nella cybersecurity, questa dualità è inevitabile. Quando un professionista chiede a un modello di "correggere questo codice", la richiesta innesca un'azione difensiva. Ma il processo di ragionamento che produce la correzione — identificare funzioni insicure, tracciare input non attendibili, mappare i flussi di esecuzione — rivela inevitabilmente come la vulnerabilità possa essere attivata. La spiegazione funge da tabella di marcia per lo sfruttamento.

Poiché i team di sicurezza dell'IA spesso addestrano i modelli a rifiutare qualsiasi prompt che sembri uno sfruttamento, i sistemi tendono spesso a sovra-correggersi. Un ricercatore che chiede come sanificare l'input dell'utente ottiene una risposta. Un ricercatore che chiede come un