Il nuovo header beta di Anthropic riduce il costo dei token per le chiamate agli strumenti (tool calls) di circa il 14% per Claude 3.7 Sonnet, offrendo agli agenti AI una modesta riduzione nelle fatture mensili e un leggero vantaggio in termini di latenza.

Perché l'uso degli strumenti consuma token

Ogni interazione di un agente con Claude prevede tre passaggi basati sui token:

  • Definizioni degli strumenti (tool definitions) – i nomi e gli schemi JSON che invii come parte del prompt.
  • Chiamate agli strumenti (tool calls) – l'output strutturato che il modello genera quando decide di invocare uno strumento.
  • Risultati degli strumenti (tool results) – i dati che il tuo codice restituisce al modello.

Il primo e il terzo passaggio sono token di input; il secondo passaggio consiste in token di output. Poiché Claude applica tariffe più elevate per l'output rispetto all'input, ridurre i token di output può abbassare i costi anche se il conteggio totale dei token rimane simile.

L'header beta

Anthropic ha annunciato una funzionalità beta denominata token-efficient tool use. L'aggiunta dell'header HTTP

anthropic-beta: token-efficient-tools-2025-02-19

attiva l'ottimizzazione, ma solo quando la richiesta è rivolta a Claude 3.7 Sonnet. Se l'header viene inviato a qualsiasi altro modello, la richiesta procede invariata; l'header viene ignorato senza errori.

L'ottimizzazione funziona comprimendo l'output delle chiamate agli strumenti del modello, riducendo di circa il 14% il conteggio dei token di output per quel passaggio.

Quanto si risparmia effettivamente

I token di output sono più costosi di quelli di input, quindi un taglio del 14% su quella quota non si traduce in una diminuzione proporzionale della fattura totale. In un tipico ciclo dell'agente in quattro passaggi, le definizioni degli strumenti dominano spesso i costi di input, superando talvolta la metà dei token utilizzati. In queste condizioni, il risparmio del 14% sui token di output produce tipicamente solo una riduzione di circa il 3% dell'importo totale.

La cifra del risparmio dichiarata appare quindi modesta, ma il cambiamento non comporta costi aggiuntivi e introduce un leggero miglioramento della latenza: meno token di output significano che il modello completa la generazione una frazione di secondo più velocemente.

Risparmi maggiori richiedono tattiche diverse

Se l'obiettivo è contenere significativamente le spese, l'header da solo non basterà. Tre leve pratiche possono offrire vantaggi maggiori:

  • Prompt caching – memorizza le definizioni degli strumenti una sola volta e riutilizza la versione in cache nelle chiamate successive. Le letture dalla cache vengono fatturate a una tariffa inferiore rispetto ai nuovi token di input.
  • Ridurre il set di strumenti – includi solo gli strumenti essenziali per il compito corrente. Ogni strumento extra aggiunge la propria definizione a ogni richiesta, gonfiando i costi di input.
  • Snellire i risultati degli strumenti – restituisci solo i campi di cui il modello ha effettivamente bisogno. Le risposte API di grandi dimensioni che vengono reinserite nella conversazione gonfiano sia i token di input che la cronologia della conversazione.

L'applicazione di queste pratiche può ridurre una parte considerevole della spesa totale, ben oltre il 3% che si otterrebbe con la sola versione beta.

Cosa monitorare

Anthropic non ha indicato quando — o se — la modalità token-efficient passerà dalla fase beta a una funzionalità predefinita. Gli sviluppatori dovrebbero prestare attenzione ai futuri annunci che potrebbero estendere il supporto oltre Claude 3.7 Sonnet o introdurre tecniche di compressione dei token più profonde. Monitorare la suddivisione dei token per richiesta aiuterà anche a quantificare l'impatto nel mondo reale man mano che i modelli di utilizzo evolvono.

In sintesi

L'header beta è una modifica gratuita e di facile implementazione che riduce i token di output delle chiamate agli strumenti di circa il 14%, offrendo una modesta riduzione della fattura e un piccolo incremento di velocità. Per chiunque stia già lottando con gli elevati costi degli agenti, l'header è un'aggiunta utile, ma i risparmi reali arriveranno dal caching dei prompt, dalla limitazione dell'esposizione degli strumenti e dalla restituzione di risultati più snelli.

Fonte: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l