Il nuovo header beta di Anthropic riduce il costo dei token per le chiamate agli strumenti (tool calls) di circa il 14% per Claude 3.7 Sonnet, offrendo agli agenti AI una modesta riduzione nelle fatture mensili e un leggero vantaggio in termini di latenza.
Perché l'uso degli strumenti consuma token
Ogni interazione di un agente con Claude prevede tre passaggi basati sui token:
- Definizioni degli strumenti (tool definitions) – i nomi e gli schemi JSON che invii come parte del prompt.
- Chiamate agli strumenti (tool calls) – l'output strutturato che il modello genera quando decide di invocare uno strumento.
- Risultati degli strumenti (tool results) – i dati che il tuo codice restituisce al modello.
Il primo e il terzo passaggio sono token di input; il secondo passaggio consiste in token di output. Poiché Claude applica tariffe più elevate per l'output rispetto all'input, ridurre i token di output può abbassare i costi anche se il conteggio totale dei token rimane simile.
L'header beta
Anthropic ha annunciato una funzionalità beta denominata token-efficient tool use. L'aggiunta dell'header HTTP
anthropic-beta: token-efficient-tools-2025-02-19
attiva l'ottimizzazione, ma solo quando la richiesta è rivolta a Claude 3.7 Sonnet. Se l'header viene inviato a qualsiasi altro modello, la richiesta procede invariata; l'header viene ignorato senza errori.
L'ottimizzazione funziona comprimendo l'output delle chiamate agli strumenti del modello, riducendo di circa il 14% il conteggio dei token di output per quel passaggio.
Quanto si risparmia effettivamente
I token di output sono più costosi di quelli di input, quindi un taglio del 14% su quella quota non si traduce in una diminuzione proporzionale della fattura totale. In un tipico ciclo dell'agente in quattro passaggi, le definizioni degli strumenti dominano spesso i costi di input, superando talvolta la metà dei token utilizzati. In queste condizioni, il risparmio del 14% sui token di output produce tipicamente solo una riduzione di circa il 3% dell'importo totale.
La cifra del risparmio dichiarata appare quindi modesta, ma il cambiamento non comporta costi aggiuntivi e introduce un leggero miglioramento della latenza: meno token di output significano che il modello completa la generazione una frazione di secondo più velocemente.
Risparmi maggiori richiedono tattiche diverse
Se l'obiettivo è contenere significativamente le spese, l'header da solo non basterà. Tre leve pratiche possono offrire vantaggi maggiori:
- Prompt caching – memorizza le definizioni degli strumenti una sola volta e riutilizza la versione in cache nelle chiamate successive. Le letture dalla cache vengono fatturate a una tariffa inferiore rispetto ai nuovi token di input.
- Ridurre il set di strumenti – includi solo gli strumenti essenziali per il compito corrente. Ogni strumento extra aggiunge la propria definizione a ogni richiesta, gonfiando i costi di input.
- Snellire i risultati degli strumenti – restituisci solo i campi di cui il modello ha effettivamente bisogno. Le risposte API di grandi dimensioni che vengono reinserite nella conversazione gonfiano sia i token di input che la cronologia della conversazione.
L'applicazione di queste pratiche può ridurre una parte considerevole della spesa totale, ben oltre il 3% che si otterrebbe con la sola versione beta.
Cosa monitorare
Anthropic non ha indicato quando — o se — la modalità token-efficient passerà dalla fase beta a una funzionalità predefinita. Gli sviluppatori dovrebbero prestare attenzione ai futuri annunci che potrebbero estendere il supporto oltre Claude 3.7 Sonnet o introdurre tecniche di compressione dei token più profonde. Monitorare la suddivisione dei token per richiesta aiuterà anche a quantificare l'impatto nel mondo reale man mano che i modelli di utilizzo evolvono.
In sintesi
L'header beta è una modifica gratuita e di facile implementazione che riduce i token di output delle chiamate agli strumenti di circa il 14%, offrendo una modesta riduzione della fattura e un piccolo incremento di velocità. Per chiunque stia già lottando con gli elevati costi degli agenti, l'header è un'aggiunta utile, ma i risparmi reali arriveranno dal caching dei prompt, dalla limitazione dell'esposizione degli strumenti e dalla restituzione di risultati più snelli.
Fonte: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
