Gli strumenti MCP aumentano, non riducono, il costo dei token di input di Claude Code; ogni prompt inviato tramite uno strumento di pulizia finisce per costare più token e, di conseguenza, più denaro. Gli sviluppatori che cercano di abbassare i costi delle API spesso ricorrono a pulitori basati su MCP, assumendo che ridurranno il prompt prima che il modello lo veda.
Perché il contatore dei token è importante
Claude Code conta i token nell'istante in cui il testo raggiunge la finestra di contesto del modello. Il modello inizia a leggere il prompt originale e poi decide se invocare uno strumento MCP. Lo strumento di pulizia viene eseguito dopo che il testo originale è già parte della conversazione, quindi il contatore ha già registrato quei token.
Un flusso tipico è il seguente:
- Il tuo prompt originale viene inviato – il contatore dei token avanza.
- Il modello legge il prompt e decide di chiamare lo strumento di pulizia.
- Lo strumento restituisce una versione accorciata.
- Il contesto ora contiene tre elementi: il prompt originale, i metadati della chiamata allo strumento e il prompt pulito.
Vieni fatturato per tutte e tre le voci. La versione "pulita" non sostituisce l'originale; si limita a trovarsi accanto ad esso.
Quando la pulizia tramite MCP è utile
Uno strumento MCP fa risparmiare token solo quando il testo originale non entra mai nel contesto principale di Claude Code. Ciò avviene per le chiamate downstream, come:
- Query di Retrieval-augmented generation (RAG) che il modello inoltra a un motore di ricerca o a un database.
- Istruzioni inviate a sub-agent che agiscono indipendentemente dalla conversazione principale.
In questi casi, il modello inoltra il payload pulito direttamente al sistema esterno, escludendo il testo originale dell'utente dal conteggio principale dei token.
Come ridurre effettivamente i token di input
Se vuoi ridurre il numero di token che fornisci a Claude Code, pulisci il testo prima che tocchi il modello. Ecco tre approcci pratici attualmente utilizzabili:
- Scorciatoie a livello di sistema – Su Windows usa lo script AutoHotkey; su macOS usa Automator. Lo script seleziona il testo che stai per inviare, lo passa a un'API esterna che restituisce una versione pulita e poi sostituisce il testo nell'editor. Poiché la versione originale non lascia mai la tua macchina, viene inviata solo la versione pulita.
- Piping via CLI – Avvia Claude Code da un terminale e pre-elabora il tuo prompt con un filtro bash (ad esempio, uno script
sedo Python) che rimuove spazi bianchi non necessari, commenti o frasi duplicate. L'output filtrato è ciò che viene fornito al modello. - MCP solo per le chiamate downstream – Riserva gli strumenti MCP per le fasi RAG o per i sub-agent descritti in precedenza. Lascia che il modello gestisca direttamente il prompt iniziale dell'utente e che lo strumento di pulizia agisca solo sul payload che esce dalla conversazione principale.
Errori comuni da evitare
- Assumere che gli strumenti MCP accorcino il prompt originale – Essi aggiungono un blocco di token per la chiamata allo strumento e preservano il testo originale, gonfiando il conteggio totale.
- Affidarsi agli hook di Claude Code – Gli hook possono iniettare contesto extra o bloccare i prompt, ma non possono sovrascrivere il testo già presente nella conversazione.
- Usare slash command con pulizia inline – Anche se un comando esegue uno script di pulizia, gli argomenti originali rimangono parte della riga di comando che il modello registra, quindi pagherai anche per quelli.
Il contatore dei token parte nell'istante in cui i caratteri raggiungono l'endpoint API del modello. Qualsiasi operazione di pulizia successiva a quel punto aggiunge solo costi accessori.
Cosa significa per gli sviluppatori
Il prezzo dei token appare come una voce di spesa nella maggior parte delle fatture dei servizi AI. Pagare troppo perché un "pulitore" aggiunge token nascosti può erodere rapidamente qualsiasi risparmio sperato. Sposta la fase di pulizia sul lato client per mantenere il conteggio dei token onesto e il budget prevedibile.
In sintesi: Gli strumenti MCP sono utili per i payload downstream, ma non possono ridurre i token del prompt che digiti. Pulisci prima di inviare, o limita la pulizia alle chiamate che non appaiono mai nel contesto principale, se desideri una riduzione reale dei costi dei token di Claude Code.
