As ferramentas MCP aumentam, em vez de reduzir, a sua fatura de tokens de entrada do Claude Code; cada prompt que você envia por meio de uma ferramenta de limpeza acaba custando mais tokens e, portanto, mais dinheiro. Desenvolvedores que buscam custos de API mais baixos costumam recorrer a limpadores baseados em MCP, assumindo que eles reduzirão o prompt antes que o modelo o veja.
Por que o medidor de tokens importa
O Claude Code conta os tokens no instante em que o seu texto chega à janela de contexto do modelo. O modelo começa a ler o prompt bruto e, em seguida, decide se deve invocar uma ferramenta MCP. A ferramenta de limpeza é executada depois que o texto original já faz parte da conversa, portanto, o medidor já registrou esses tokens.
Um fluxo típico funciona assim:
- O seu prompt bruto é enviado – o contador de tokens avança.
- O modelo lê o prompt e decide chamar a ferramenta de limpeza.
- A ferramenta retorna uma versão reduzida.
- O contexto agora contém três elementos: o prompt original, os metadados da chamada da ferramenta e o prompt limpo.
Você é cobrado pelas três entradas. A versão "limpa" não substitui a original; ela apenas fica ao lado dela.
Quando a limpeza via MCP realmente ajuda
Uma ferramenta MCP economiza tokens apenas quando o texto bruto nunca entra no contexto principal do Claude Code. Isso ocorre em chamadas downstream, tais como:
- Consultas de geração aumentada por recuperação (RAG) que o modelo encaminha para um mecanismo de busca ou banco de dados.
- Instruções enviadas para subagentes que atuam de forma independente da conversa principal.
Nesses casos, o modelo encaminha o payload limpo diretamente para o sistema externo, mantendo o texto original do usuário fora da contagem principal de tokens.
Como realmente reduzir seus tokens de entrada
Se você deseja reduzir o número de tokens que envia ao Claude Code, limpe o texto antes que ele toque o modelo. Aqui estão três abordagens práticas que funcionam hoje:
- Atalhos de nível de sistema – No Windows, use o script AutoHotkey; no macOS, use o Automator. O script seleciona o texto que você está prestes a enviar, passa-o para uma API externa que retorna uma versão limpa e, em seguida, substitui o texto no editor. Como a versão bruta nunca sai da sua máquina, apenas a versão limpa é enviada.
- Piping via CLI – Inicie o Claude Code a partir de um terminal e pré-processe seu prompt com um filtro bash (por exemplo, um script
sedou Python) que remova espaços em branco desnecessários, comentários ou frases duplicadas. O resultado filtrado é o que é enviado ao modelo. - MCP apenas para chamadas downstream – Reserve as ferramentas MCP para as etapas de RAG ou subagentes descritas anteriormente. Deixe o modelo lidar diretamente com o prompt inicial do usuário e deixe a ferramenta de limpeza agir apenas no payload que sai da conversa principal.
Armadilhas comuns para evitar
- Assumir que as ferramentas MCP reduzem o prompt original – Elas adicionam um bloco de tokens de chamada de ferramenta e preservam o texto bruto, inflando a contagem total.
- Confiar em hooks do Claude Code – Os hooks podem injetar contexto extra ou bloquear prompts, mas não podem sobrescrever o texto que já está na conversa.
- Usar comandos de barra (slash commands) com limpeza inline – Mesmo que um comando execute um script de limpeza, os argumentos brutos permanecem parte da linha de comando que o modelo registra, portanto, você também paga por eles.
O medidor de tokens começa no instante em que seus caracteres atingem o endpoint da API do modelo. Qualquer coisa que realize a limpeza após esse ponto apenas adiciona sobrecarga (overhead).
O que isso significa para os desenvolvedores
O preço dos tokens aparece como um item na fatura da maioria dos serviços de IA. Pagar a mais porque um "limpador" adiciona tokens ocultos pode rapidamente corroer qualquer economia que você esperava obter. Mova a etapa de limpeza para o lado do cliente para manter a contagem de tokens honesta e seu orçamento previsível.
Resumo: As ferramentas MCP são úteis para payloads downstream, mas não podem reduzir os tokens do prompt que você digita. Limpe antes de enviar, ou restrinja a limpeza a chamadas que nunca aparecem no contexto principal, se quiser uma redução real nos custos de tokens do Claude Code.
