Os servidores MCP são a nova e empolgante infraestrutura para o Claude Code. Adicione um servidor do GitHub e seu agente poderá abrir pull requests. Adicione um servidor de filesystem e ele lerá a estrutura do seu repositório. As demonstrações parecem mágicas. O que ninguém demonstra é a fatura.
O custo não está nas chamadas de API que as ferramentas fazem. Está nas próprias ferramentas.
Cada vez que você registra um servidor MCP, não está apenas adicionando uma funcionalidade. Você está adicionando um bloco de texto à sua janela de contexto, e esse bloco é cobrado em cada turno. Quer o agente use a ferramenta ou não, você paga pela existência dela. O medidor começa a rodar no momento em que o servidor se conecta.
Pagando Aluguel por Ferramentas que Você Nunca Usa
Aqui está a mecânica que costuma ser ignorada. Cada definição de ferramenta em um servidor MCP vem com um nome, uma descrição e um JSON schema que diz ao modelo quais argumentos a ferramenta espera. Todo esse payload é injetado no contexto do sistema no início de cada turno. O modelo precisa ver o catálogo completo para poder decidir se deve chamar uma ferramenta, mas é você quem paga a conta por essa visibilidade.
O overhead por ferramenta não é trivial. Na prática, uma única definição de ferramenta consome entre 80 e 150 tokens. Isso significa que um servidor modesto expondo dez ferramentas consome silenciosamente de 800 a 1.500 tokens antes mesmo de você digitar uma única frase. Você não está pagando por processamento. Você está pagando pelo privilégio de ter a opção.
Eu analisei os números em uma sessão padrão de 20 turnos para ver exatamente como isso se acumula.
Sem nenhum servidor MCP carregado, o overhead é zero. A janela de contexto contém apenas a sua conversa.
Carregue um servidor mínimo personalizado com três ferramentas de escopo restrito, e a taxa é de 180 tokens por turno. Ao longo de 20 turnos, são 3.600 tokens perdidos. Não é um desastre, mas é dinheiro real.
O popular servidor de filesystem, que expõe sete ferramentas, eleva isso para 640 tokens por turno. Na mesma sessão, você terá queimado 12.800 tokens apenas para manter a conexão. Você ainda não leu um arquivo. Você ainda não listou um diretório. Você apenas manteve o servidor no menu.
Depois, há o servidor do GitHub. Com 26 ferramentas registradas, ele despeja 3.100 tokens em cada turno. Após 20 mensagens de ida e volta, o overhead totaliza 62.000 tokens. Com os preços do Sonnet 4, isso representa US$ 0,19 em pura taxa de contexto. Você pagou dezenove centavos de overhead antes mesmo de o agente considerar a criação de uma issue.
Esse valor parece pequeno isoladamente. Mas não é.
O Problema do Agente de Longa Duração
Onde isso dói é em loops autônomos de longa duração. Se você estiver usando o Claude Code como um agente que itera por conta própria, essa taxa por turno se multiplica brutalmente. Um agente rodando durante a noite ao longo de 2.000 turnos com o servidor do GitHub carregado não paga 62.000 tokens de overhead. Ele paga 6,2 milhões.
Isso representa US$ 18,60 gastos em literalmente nada de produtivo. O agente pode ter passado a noite inteira sem tocar em uma única ferramenta do GitHub. Ele pode ter trabalhado inteiramente em arquivos locais. Você ainda será cobrado por todas as 26 definições de ferramentas do GitHub em cada um desses 2.000 turnos porque elas estavam registradas na sessão.
O ponto crítico a ser internalizado é que você paga pelas ferramentas registradas, não pelas ferramentas chamadas. O modelo não verifica quais ferramentas ele realmente usa para depois dar um desconto na sua conta. Se o servidor estiver conectado, seu manifesto completo é reintroduzido no contexto a cada ciclo. Esta é uma taxa por turno sobre o potencial, não sobre a ação.
Para desenvolvedores que executam agentes de codificação iterativos, suítes de testes ou tarefas de revisão em lote, isso é um assassino silencioso de orçamento. Uma conversa humana de 20 turnos é leve. Um loop agêntico de 200 ou 2.000 turnos é onde a matemática se torna punitiva.
Como Manter os Custos sob Controle
O MCP é genuinamente útil. Você deve usá-lo. Mas trate-o como um utilitário que você liga para o trabalho em questão, não como um acessório permanente que você acopla a todas as sessões.
Limite as Configurações ao Projeto e à Tarefa
Não carregue todos os servidores na sua configuração global do Claude Code por padrão. Crie configurações de MCP baseadas no projeto que correspondam ao trabalho que você está realmente fazendo. Se estiver refatorando um módulo local, provavelmente precisará apenas do servidor de filesystem e nada mais. Se estiver triando issues, carregue o servidor do GitHub para essa tarefa específica e desconecte-o quando voltar ao desenvolvimento local.
Pense nisso como deixar aplicativos abertos no seu celular. Um ou dois está tudo bem. Vinte rodando em segundo plano drenam a bateria sem motivo.
Prefira Servidores com Menos Ferramentas
Not all MCP servers are designed with the same discipline. Some expose a lean interface of two or three focused actions. Others ship a sprawling catalog of 25 or 30 tools, many of which you will never invoke. A server with three tools might cost you 180 tokens per turn. One with 26 tools can cost 3,100. That is a 17x jump in overhead for a capability gap that may not matter to you.
Before installing a server, look at its tool manifest. If it registers a dozen overlapping operations and you only need one, consider whether you can configure it down, fork it, or write a slimmer wrapper. Every tool definition you can strip out is a direct and permanent token saving on every future turn.
Trim Tool Descriptions
The 80 to 150 token range per tool is not a law of nature. It is a function of how verbose the descriptions and schemas are. A bloated 400-token description eats five times the context of an 80-token description, and that fivefold penalty applies on every single turn.
Audit the servers you rely on. If a tool description reads like marketing copy, rewrite it. Cut adjectives. Cut examples that do not clarify the schema. Tighten the JSON. The model needs to understand what the tool does, but it does not need a paragraph of preamble. Treat tool definitions like code: the shorter and clearer, the better.
The Real Takeaway
MCP extends what Claude Code can reach. It does not extend your context window for free. The overhead is deterministic, recurring, and entirely disconnected from whether the tools see action.
Load only the servers your current task demands. Disconnect them when you are done. Audit tool counts and description lengths like you would audit any other dependency. The rule is simple: if the tool is not adding value in this specific session, it should not be adding tokens to your bill.
Source measurements and methodology: I added MCP servers to Claude Code — here’s what they cost in tokens
Join the GyaanSetu AI learning community for more engineering breakdowns: t.me/GyaanSetuAi
