OpenAI ha lanciato oggi GPT-Red, un modello linguistico di grandi dimensioni che agisce come un hacker red-team automatizzato. Il sistema sta già rinforzando l'ultimo modello GPT-5.6 dell'azienda, riducendo drasticamente il tasso di successo degli attacchi simulati da oltre il 90% a meno del 23%.

Come GPT-Red automatizza il lavoro di red-team

I test di red-team — ovvero il tentativo deliberato di violare o di dirottare un sistema — si sono tradizionalmente basati su esperti di sicurezza. Man mano che gli LLM imparano a navigare sul web, eseguire codice e chiamare servizi di terze parti, i modi in cui possono essere utilizzati impropriamente si moltiplicano più velocemente di quanto un team umano possa esplorare.

OpenAI ha risposto con un "ciclo di self-play" che mette una copia di un modello contro un'altra all'interno di un ambiente simulato che i ricercatori chiamano "dojo". In questa sandbox, GPT-Red assume il ruolo dell'attaccante, mentre uno o più modelli difensori cercano di resistere. Le due parti affrontano innumerevoli round; ogni iterazione costringe l'attaccante a scoprire falle più sottili e il difensore ad apprendere nuove difese. OpenAI ha integrato questo processo nella pipeline di addestramento che ha prodotto GPT-5.6, che l'azienda presenta come il suo rilascio più robusto finora.

Una nuova classe di attacco: la "fake chain of thought"

Le sessioni di self-play hanno svelato un sorprendente attacco di tipo "fake chain of thought" (falsa catena di pensiero). Gli LLM spesso emettono una traccia di ragionamento passo dopo passo — una "chain of thought" — che guida la risposta finale. GPT-Red ha imparato a inserire voci spurie in quella traccia, inducendo il modello a pensare di aver già verificato premesse false. Ad esempio, l'attaccante può convincere il modello che "1 + 1 = 3" sia stato verificato, spingendo il sistema a produrre output basati sul risultato fabbricato.

L'attacco non si limita ai generatori di solo testo. In un test contro "Vendy", un agente in stile distributore automatico costruito da un laboratorio esterno, GPT-Red ha manipolato i campi dei prezzi e annullato ordini, dimostrando che la tecnica funziona anche contro agenti specializzati che agiscono su comandi dell'utente.

Miglioramento della sicurezza misurabile

OpenAI ha rilasciato dati che mostrano l'impatto dell'addestramento contro GPT-Red. Quando gli attacchi più forti generati dal nuovo modello sono stati eseguiti contro il GPT-5 rilasciato ad agosto, hanno avuto successo in più del 90% dei casi. Gli stessi attacchi contro GPT-5.6 hanno avuto successo in meno del 23% dei casi.

In un esperimento del 2025 che ha messo GPT-Red contro red-teamer umani, l'IA ha scoperto e perfezionato varianti di attacco in modo più efficiente rispetto agli esseri umani, suggerendo che un modello avversario possa esplorare una porzione più ampia dello spazio delle vulnerabilità in meno tempo.

Limiti e continua necessità di competenza umana

GPT-Red non sostituisce gli analisti di sicurezza umani. Si scontra ancora con attacchi conversazionali multi-turno, in cui l'attaccante costruisce una narrazione attraverso diversi scambi, e con le visual prompt injection che nascondono testo malevolo all'interno delle immagini. OpenAI prevede di utilizzare il modello come sonda di prima linea, facendo emergere idee di attacco promettenti che gli esperti umani potranno investigare ed estendere.

Lo strumento rimane proprietario, quindi i ricercatori esterni non possono testarne direttamente le capacità o verificare i miglioramenti riportati.