Les outils MCP augmentent, au lieu de réduire, votre facture de tokens d'entrée pour Claude Code ; chaque prompt que vous envoyez via un outil de nettoyage finit par coûter plus de tokens, et donc plus d'argent. Les développeurs cherchant à réduire les coûts d'API se tournent souvent vers des nettoyeurs basés sur MCP, supposant qu'ils réduiront le prompt avant que le modèle ne le voie.

Pourquoi le compteur de tokens est crucial

Claude Code compte les tokens dès l'instant où votre texte atteint la fenêtre de contexte du modèle. Le modèle commence à lire le prompt brut, puis décide s'il doit invoquer un outil MCP. L'outil de nettoyage s'exécute après que le texte original fait déjà partie de la conversation, le compteur a donc déjà enregistré ces tokens.

Un flux typique ressemble à ceci :

  1. Votre prompt brut est soumis – le compteur de tokens s'incrémente.
  2. Le modèle lit le prompt et décide d'appeler l'outil de nettoyage.
  3. L'outil renvoie une version tronquée.
  4. Le contexte contient désormais trois éléments : le prompt original, les métadonnées d'appel d'outil et le prompt nettoyé.

Vous êtes facturé pour ces trois entrées. La version « propre » ne remplace pas l'originale ; elle se contente de s'y ajouter.

Quand le nettoyage MCP est utile

Un outil MCP n'économise des tokens que lorsque le texte brut n'entre jamais dans le contexte principal de Claude Code. Cela se produit lors d'appels en aval tels que :

  • Les requêtes de génération augmentée par récupération (RAG) que le modèle transmet à un moteur de recherche ou à une base de données.
  • Les instructions envoyées à des sous-agents qui agissent indépendamment de la conversation principale.

Dans ces cas, le modèle transmet directement la charge utile nettoyée au système externe, évitant ainsi que le texte original de l'utilisateur ne soit inclus dans le décompte principal des tokens.

Comment réellement réduire vos tokens d'entrée

Si vous voulez réduire le nombre de tokens que vous envoyez à Claude Code, nettoyez le texte avant qu'il ne touche le modèle. Voici trois approches pratiques applicables dès aujourd'hui :

  • Raccourcis clavier au niveau du système – Sur Windows, utilisez le script AutoHotkey ; sur macOS, utilisez Automator. Le script sélectionne le texte que vous vous apprêtez à envoyer, le redirige vers une API externe qui renvoie une version nettoyée, puis remplace le texte dans l'éditeur. Comme la version brute ne quitte jamais votre machine, seule la version nettoyée est soumise.
  • Redirection CLI (piping) – Lancez Claude Code depuis un terminal et pré-traitez votre prompt avec un filtre bash (par exemple, un script sed ou Python) qui supprime les espaces inutiles, les commentaires ou les phrases dupliquées. C'est la sortie filtrée qui est transmise au modèle.
  • MCP uniquement pour les appels en aval – Réservez les outils MCP pour les étapes de RAG ou de sous-agents décrites précédemment. Laissez le modèle gérer directement le prompt initial de l'utilisateur, et laissez l'outil de nettoyage n'agir que sur la charge utile qui quitte la conversation principale.

Pièges courants à éviter

  • Supposer que les outils MCP tronquent le prompt original – Ils ajoutent un bloc de tokens d'appel d'outil et conservent le texte brut, gonflant ainsi le décompte total.
  • Compter sur les hooks de Claude Code – Les hooks peuvent injecter un contexte supplémentaire ou bloquer des prompts, mais ils ne peuvent pas écraser le texte déjà présent dans la conversation.
  • Utiliser des commandes slash avec nettoyage en ligne – Même si une commande exécute un script de nettoyage, les arguments bruts restent partie intégrante de la ligne de commande que le modèle enregistre, vous payez donc aussi pour eux.

Le compteur de tokens démarre dès l'instant où vos caractères atteignent le point de terminaison (endpoint) de l'API du modèle. Tout ce qui nettoie après ce point ne fait qu'ajouter des frais supplémentaires.

Ce que cela signifie pour les développeurs

Le prix des tokens apparaît comme un poste de dépense sur la plupart des factures de services d'IA. Payer trop cher parce qu'un « nettoyeur » ajoute des tokens cachés peut rapidement éroder les économies que vous espériez réaliser. Déplacez l'étape de nettoyage du côté client pour garder un décompte de tokens honnête et un budget prévisible.

À retenir : Les outils MCP sont utiles pour les charges utiles en aval, mais ils ne peuvent pas réduire les tokens du prompt que vous tapez. Nettoyez avant d'envoyer, ou limitez le nettoyage aux appels qui n'apparaissent jamais dans le contexte principal, si vous voulez une véritable réduction des coûts de tokens de Claude Code.