Un ricercatore indipendente ha registrato ogni token consumato dal suo agente di ricerca basato su LLM per un mese, riuscendo a ridurre la bolletta del 31%. La spesa è scesa da 945 $ a 651 $, mentre il tasso di successo è salito leggermente dal 91% al 93%, un risultato che chiunque gestisca workflow di IA sensibili ai costi noterà sicuramente.
Perché i dati a livello di token sono stati fondamentali
La maggior parte degli utenti di LLM vede solo la fattura finale: una somma forfettaria che nasconde il costo di ogni sotto-attività. L'agente del ricercatore svolgeva tre azioni principali: la ricerca di documenti SEC, la stesura di report e l'assemblaggio di sintesi di ricerca. Senza dati granulari, non avrebbe potuto capire se i 312 $ pagati a giugno fossero stati spesi bene.
Per individuare le perdite nascoste, ha aggiunto uno strato di logging in PostgreSQL che catturava il nome del modello, il conteggio dei token, il tipo di attività e il costo per singola chiamata. Dopo 30 giorni, i dati hanno delineato un quadro chiaro:
- Ricerca documenti SEC – 41% della spesa totale
- Stesura report – 28%
- Sintesi di ricerca – 17%
- Controlli di qualità – 9%
- Varie – 5%
I numeri hanno mostrato che il passaggio più costoso non era il modello in sé, ma il modo in cui l'agente inseriva i risultati di ricerca grezzi nei prompt.
Tre modifiche che hanno generato il risparmio
1. Riassumi prima di inviare il prompt
Inizialmente, l'agente inseriva 20 risultati di ricerca grezzi in ogni prompt, gonfiando l'input con un numero elevato di token. Ha inserito prima un riassuntore economico, riducendo drasticamente l'input. Il costo per ogni attività di ricerca è sceso da 0,84 $ a 0,19 $, con una riduzione del 77%.
2. Instrada i controlli semplici verso un modello più economico
I controlli di qualità venivano eseguiti su un modello di fascia alta che costa 0,09 $ per controllo. Ha sostituito la maggior parte dei controlli pass/fail con un modello a prezzo inferiore, riducendo il costo per controllo a 0,01 $. Il modello più economico ha risposto correttamente l'89% delle volte; ogni errore veniva poi gestito dal modello originale, preservando l'accuratezza e riducendo al contempo i costi dell'87%.
3. Salta i controlli quando la fiducia è alta
Ha aggiunto una regola per bypassare la fase di controllo qualità ogni volta che il tasso di successo storico dell'attività era elevato e la lunghezza dell'output rientrava nei limiti previsti. Ciò ha eliminato circa il 60% dei controlli che sarebbero stati eseguiti comunque.
Il risultato
Con le tre modifiche implementate, il bilancio mensile è apparso così:
- Spesa totale: 945 $ → 651 $ (riduzione del 31%)
- Costo ricerca SEC per attività: 0,84 $ → 0,19 $ (riduzione del 77%)
- Costo controllo qualità per attività: 0,09 $ → 0,01 $ (riduzione dell'87%)
- Tasso di successo complessivo: 91% → 93%
Il tasso di successo più elevato suggerisce che i prompt più brevi abbiano ridotto il rumore e aiutato il modello a concentrarsi sulla domanda principale.
Avvertenze e controargomentazioni
L'approccio si basa su due presupposti. Primo, il riassuntore più economico deve conservare informazioni sufficienti per il ragionamento a valle; se scarta dettagli critici, la qualità dell'output potrebbe risentirne. Secondo, il modello a basso costo utilizzato per i controlli di qualità non è perfetto; la sua accuratezza dell'89% significa che una piccola frazione di errori raggiunge comunque il prodotto finale, anche se il percorso di escalation ne intercetta la maggior parte. Gli utenti con esigenze di conformità più rigorose potrebbero necessitare di soglie più strette o passaggi di validazione extra.
Cosa significa questo per i professionisti degli LLM
- Le dashboard granulari vincono. I report di spesa ad alto livello nascondono lo spreco di token. Registrare l'utilizzo per attività rivela inefficienze che altrimenti rimarrebbero nascoste.
- I modelli frontier non sono sempre necessari. Un modello economico può comprimere i dati o prendere semplici decisioni binarie senza compromettere la qualità complessiva.
Il costo nascosto di un agente LLM è spesso il lavoro non misurato che svolge. Monitorando il flusso di token e applicando ottimizzazioni mirate, il ricercatore ha trasformato una bolletta mensile di 945 $ in un'operazione più snella da 651 $, migliorando al contempo le prestazioni. Per chiunque debba pianificare il budget per i carichi di lavoro AI, la lezione è chiara: misura ogni token, poi lascia che siano i dati a dettare dove tagliare.
