Il tuo agente basato su LLM potrebbe funzionare perfettamente in una demo, per poi rallentare e far lievitare la fattura dopo pochi passaggi. Il colpevole nascosto non è un modello instabile, ma il token drift: l'ingrossamento graduale del prompt che il modello deve elaborare ogni volta.

Il token drift si verifica quando ogni interazione aggiunge altro testo al contesto di input del modello. La cronologia della conversazione, gli schemi degli strumenti, le risposte API e i documenti recuperati si accumulano, rendendo ogni chiamata successiva dotata di un payload più pesante. Poiché il tempo di elaborazione e il prezzo del modello aumentano con il numero di token di input, il costo cresce in modo quadratico anziché lineare.

Perché il problema si presenta in produzione e non nelle demo

Le implementazioni reali conservano tutto: ogni espressione dell'utente, ogni output degli strumenti, ogni frammento di conoscenza recuperata. L'accumulo rimane nascosto finché la latenza non subisce un picco e non arriva la fattura.

Fonti comuni di token drift

  • Trascrizioni ripetute – Mantenere ogni vecchio messaggio nel prompt invece di riassumerlo o scartarlo.
  • Schemi degli strumenti pesanti – Inviare ampie definizioni JSON delle capacità degli strumenti ad ogni passaggio.
  • Risultati degli strumenti ingombranti – Includere risposte API complete o righe di database che contengono più dati di quanti l'agente ne abbia effettivamente bisogno.
  • RAG bloat – La Retrieval-augmented generation (RAG) che aggiunge molti frammenti di documenti, alcuni dei quali obsoleti o irrilevanti.
  • Memoria duplicata – Inserire insieme un riassunto, un oggetto di stato e la trascrizione grezza, ripetendo le stesse informazioni tre volte.

Ognuno di questi elementi aggiunge token che non contribuiscono a un nuovo potere di ragionamento, eppure gonfiano la dimensione del prompt.

Come mantenere sotto controllo il budget dei token

1. Adottare un design del contesto a livelli

  • Istruzioni stabili – Mantenere i system prompt e le regole di sicurezza in alto e fare riferimento ad essi invece di reinviarli ad ogni passaggio.
  • Stato strutturato – Memorizzare una rappresentazione compatta di obiettivi, decisioni e identificatori che l'agente possa leggere rapidamente.
  • Cronologia compressa – Riassumere i passaggi più vecchi in un breve paragrafo leggibile dall'uomo, aggiornandolo solo quando viene raggiunta una determinata soglia.
  • Passaggi recenti – Includere gli ultimi messaggi parola per parola per preservare la continuità.

Separare il testo costante dal contenuto riassumibile evita di reinviare le stesse parole ripetutamente.

2. Ridurre gli output degli strumenti

  • Estrarre solo i campi che l'agente utilizza effettivamente; eliminare le descrizioni prolisse.
  • Sostituire i risultati voluminosi con un riassunto conciso o un ID di riferimento, e memorizzare l'intero payload in un database, in una cache o in un blob store.
  • Quando uno strumento restituisce una lista, inviare solo i primi N elementi rilevanti per la decisione corrente.

3. Applicare un riassunto intelligente

  • Evitare di riassumere dopo ogni passaggio; l'elaborazione extra aggiunge un sovraccarico (overhead).
  • Aggiornare il riassunto solo quando il conteggio dei token accumulati dei passaggi precedenti supera un limite prestabilito.
  • Conservare i fatti critici — ID, importi, timestamp — in un archivio strutturato invece di inserirli nella prosa, in modo che il riassunto rimanga breve.

4. Monitorare le metriche corrette

  • Registrare l'uso dei token per ogni chiamata al modello, non solo per ogni richiesta dell'utente. Questo rivela la crescita nascosta sul lato dell'input.
  • Monitorare il numero di token di input aggiunti ad ogni passaggio; un salto improvviso indica una fonte di drift.
  • Separare i token in cache (riutilizzati da chiamate precedenti) dai token appena generati; solo i primi causano il drift.

Tratta il prompt come una risorsa finita, non come una trascrizione infinita. Misurando, riassumendo e riducendo deliberatamente, manterrai il tuo agente LLM veloce, conveniente e pronto per la scalabilità in produzione.

In sintesi: Il token drift aumenta silenziosamente i costi e rallenta gli agenti. Identifica le parti del prompt che crescono, comprimile o rendile esterne, e monitora l'uso dei token per ogni chiamata. Un approccio disciplinato trasforma gli shock imprevisti in fattura in un'operazione gestibile e rispettosa del budget.