I ricercatori hanno dimostrato che le tracce di ragionamento criptate — piccoli pacchetti che un provider invia al dispositivo di un utente per consentire a una conversazione di passare da un modello all'altro — possono essere decriptate da un modello più debole dello stesso servizio, esponendo centinaia di credenziali e dettagli privati. La scoperta, dettagliata nel documento Stealing Reasoning Traces from Proprietary LLM APIs, minaccia una funzionalità di comodità su cui Anthropic, OpenAI e Google fanno affidamento per mantenere fluide le chat con l'IA.
Perché esistono i blocchi criptati
Quando interagisci con un modello linguistico di grandi dimensioni (LLM), il servizio costruisce una "traccia di ragionamento": la catena di prompt interni, chiamate a strumenti (tool calls) e passaggi di chain-of-thought che hanno portato alla risposta. Per permetterti di passare da un modello più grande a uno più economico senza perdere tale catena, i provider criptano la traccia, la inviano al tuo dispositivo e si aspettano che tu la rimandi con la richiesta successiva. La crittografia ha lo scopo di mantenere privata la traccia, consentendo al contempo la continuità tra sessioni e tra modelli diversi.
Come funziona l'attacco
I ricercatori hanno dimostrato un exploit in tre fasi che non richiede alcuna violazione del modello forte stesso:
- Catturare un blocco di ragionamento criptato generato da un modello potente durante una conversazione normale.
- Alimentare quel blocco a un modello più debole dello stesso provider, chiedendogli di "leggere" il blocco.
- Poiché il modello più debole condivide le stesse chiavi di decrittazione, esso restituisce il contenuto decriptato in chiaro.
Il modello più debole agisce come un oracolo di decrittazione. Gli attaccanti non hanno mai toccato l'interno del modello forte; hanno semplicemente usato l'API del provider contro se stessa.
Cosa hanno recuperato i ricercatori
- 182 credenziali – chiavi API, token e altri segreti incorporati nella traccia.
- 367 informazioni private – nomi, email, indirizzi forniti dagli utenti durante la chat.
- Payload di prompt injection – istruzioni malevole nascoste nel blocco criptato che potrebbero essere eseguite in seguito quando la traccia viene riprodotta.
- Bypass dei filtri di sicurezza – la traccia decriptata ha rivelato passaggi che sarebbero stati bloccati se esaminati in chiaro, permettendo a contenuti pericolosi di passare inosservati.
Il documento sottolinea che la debolezza non è un difetto dell'algoritmo crittografico; la crittografia stessa regge. La violazione deriva dalla scelta progettuale di consentire a qualsiasi modello della flotta del provider di decriptare il blocco per favorire l'esperienza utente.
Il compromesso al centro del problema
I provider hanno integrato questa capacità di "model-switching" nelle loro API perché sviluppatori e utenti finali apprezzano la continuità. Se la crittografia fosse legata a una singola istanza o sessione del modello, il passaggio fluido si interromperebbe, costringendo gli sviluppatori a ricostruire autonomamente la gestione dello stato. Il documento sostiene che la sicurezza sia stata deliberatamente sacrificata in favore della flessibilità.
Cosa dovrebbero fare gli sviluppatori ora
- Trattare le tracce criptate come testo in chiaro. Presumi che qualsiasi log, cache o sistema di monitoraggio che le memorizza possa essere letto da un attaccante.
- Evitare di caricare le tracce in repository pubblici. Anche un singolo blocco errato può esporre decine di segreti.
- Pianificare controlli più stringenti. I provider potrebbero inasprire la sicurezza, il che potrebbe cambiare il modo in cui vengono costruiti gli agenti multi-modello.
- Passare a passaggi di stato espliciti. Invece di fare affidamento su un ragionamento nascosto, progetta agenti che restituiscano dati strutturati (JSON, XML, ecc.) che possano essere passati in sicurezza tra i modelli senza crittografia.
- Effettuare l'audit dei propri prompt. Cerca eventuali dati sensibili che finiscono nella catena di ragionamento e rimuovili prima di inviare la richiesta.
Cosa osservare dai grandi provider
Il rilascio del documento spingerà Anthropic, OpenAI e Google a riesaminare la politica di decrittazione integrata nelle loro API.
L'implicazione più ampia
La scoperta evidenzia un classico dilemma della sicurezza: la comodità spesso apre una porta sul retro. Consentendo a qualsiasi modello di decriptare un blocco di proprietà dell'utente, i provider hanno offerto agli attaccanti un percorso a basso sforzo per accedere a dati sensibili. La soluzione renderà probabilmente le integrazioni IA un po' più macchinose, ma ripristinerà anche l'aspettativa che i dati criptati rimangano criptati.
In sintesi: Le tracce di ragionamento criptate non sono un confine di sicurezza; sono una scorciatoia per la comodità che può essere rivolta contro di te. Trattale come testo in chiaro, rimuovile dai log e riprogetta i tuoi agenti per sopravvivere a un futuro in cui solo il modello originario potrà leggere i propri pensieri.
