Perché OpenAI si è rivolta a un attaccante AI
I tradizionali esercizi di red-teaming costringono gli ingegneri della sicurezza a testare i modelli manualmente: un processo lento e costoso, limitato dall'immaginazione umana. OpenAI ha risposto con GPT-Red, un sistema di self-play che mette un modello attaccante contro un modello difensore gemello. Ogni round di attacco fornisce nuovi dati al difensore; l'attaccante impara da ogni fallimento, creando un ciclo evolutivo che fa emergere pattern di exploit che nessun essere umano penserebbe di tentare.
I numeri che contano
- Successo degli attacchi: GPT-Red ha avuto successo nell'84% dei casi di test, contro il 13% dei red-teamer umani.
- Rafforzamento del modello: OpenAI ha inserito i risultati di GPT-Red direttamente nella pipeline di addestramento, e GPT-5.6 Sol registra ora sei volte meno fallimenti da prompt injection rispetto al modello di punta rilasciato quattro mesi prima.
- Rischio residuo: Anche con le nuove difese, circa il 3,8% delle iniezioni "più forti" riesce ancora a passare, un tasso di fallimento paragonabile a quello di Claude Opus 4.5.
Una demo dal vivo ha sottolineato la potenza del sistema: GPT-Red ha manipolato un distributore automatico controllato dall'IA nell'ufficio di OpenAI, modificando i prezzi degli articoli e annullando gli ordini senza alcun intervento umano.
Cosa significa questo miglioramento per gli utenti
OpenAI afferma che GPT-5.6 Sol mantiene la stessa velocità di ragionamento e qualità delle risposte del suo predecessore, superando il consueto compromesso tra sicurezza e utilità, in cui misure di protezione più rigide riducono l'efficacia del modello.
I limiti di un red team automatizzato
L'automazione non elimina tutti i rischi. Il tasso di successo del 3,8% per le iniezioni ad alta intensità dimostra che anche un sofisticato sistema di self-play lascia delle lacune.
Cosa osservare in seguito
- Aggiornamenti iterativi: Il ciclo di self-play continuerà a evolversi.
In sintesi
GPT-Red dimostra che un'IA può superare l'ingegno umano nel trovare difetti della propria specie, garantendo una riduzione misurabile di sei volte dei fallimenti da prompt injection per GPT-5.6. Questa svolta riduce il divario tra sicurezza e utilità, ma rimane un piccolo e reale rischio residuo. Il prossimo capitolo dipenderà da come OpenAI integrerà gli approfondimenti del red-team automatizzato con lo scrutinio esterno per restare un passo avanti rispetto agli avversari, che stanno rivolgendosi sempre più all'IA a loro volta.
