Serwery MCP to nowa, gorąca infrastruktura dla Claude Code. Dodaj serwer GitHub, a Twój agent będzie mógł otwierać pull requesty. Dodaj serwer filesystem, a on przeanalizuje strukturę Twojego repozytorium. Pokazy demo wyglądają magicznie. To, czego nikt nie pokazuje na demonstracjach, to rachunek.
Koszt nie leży w wywołaniach API wykonywanych przez narzędzia. Leży on w samych narzędziach.
Za każdym razem, gdy rejestrujesz serwer MCP, nie tylko dodajesz nową funkcjonalność. Dodajesz blok tekstu do swojego okna kontekstowego, a za ten blok płacisz przy każdym pojedynczym kroku. Niezależnie od tego, czy agent użyje narzędzia, czy nie, płacisz za jego istnienie. Licznik zaczyna bić w momencie połączenia się serwera.
Płacenie czynszu za narzędzia, których nigdy nie dotykasz
Oto mechanizm, który jest pomijany. Każda definicja narzędzia w serwerze MCP zawiera nazwę, opis oraz schemat JSON, który informuje model, jakich argumentów oczekuje narzędzie. Cały ten ładunek danych jest wstrzykiwany do kontekstu systemowego na początku każdego kroku. Model musi widzieć pełny katalog, aby móc zdecydować, czy wywołać narzędzie, ale to Ty płacisz rachunek za tę widoczność.
Narzut na każde narzędzie nie jest nieznaczny. W praktyce pojedyncza definicja narzędzia zużywa od 80 do 150 tokenów. Oznacza to, że skromny serwer udostępniający dziesięć narzędzi po cichu pochłania od 800 do 1 500 tokenów, zanim jeszcze napiszesz choćby jedno zdanie. Nie płacisz za moc obliczeniową. Płacisz za przywilej posiadania opcji.
Przeanalizowałem liczby dla standardowej sesji składającej się z 20 kroków, aby zobaczyć, jak to się kumuluje.
Przy braku załadowanych serwerów MCP narzut wynosi zero. Okno kontekstowe zawiera tylko Twoją rozmowę.
Wczytaj własny, minimalny serwer z trzema ściśle określonymi narzędziami, a podatek wyniesie 180 tokenów na krok. W ciągu 20 kroków przepada 3 600 tokenów. To nie katastrofa, ale realne pieniądze.
Popularny serwer filesystem, który udostępnia siedem narzędzi, podnosi tę wartość do 640 tokenów na krok. W tej samej sesji zużywasz 12 800 tokenów tylko po to, aby utrzymać połączenie. Nie przeczytałeś jeszcze żadnego pliku. Nie wypisałeś żadnego katalogu. Po prostu utrzymałeś serwer w menu.
Potem mamy serwer GitHub. Przy 26 zarejestrowanych narzędziach wrzuca on 3 100 tokenów do każdego kroku. Po 20 wymianach wiadomości narzut wynosi łącznie 62 000 tokenów. Przy cenach modelu Sonnet 4 to 0,19 USD czystego podatku kontekstowego. Zapłaciłeś dziewiętnaście centów za narzut, zanim agent w ogóle rozważył stworzenie issue.
Ta kwota wydaje się mała w izolacji. Ale nie jest.
Problem agentów pracujących w trybie całonocnym
Najbardziej boli to w przypadku długotrwałych, autonomicznych pętli. Jeśli używasz Claude Code jako agenta, który iteruje samodzielnie, ten podatek za każdy krok mnoży się brutalnie. Agent pracujący przez całą noc, wykonujący 2 000 kroków z załadowanym serwerem GitHub, nie płaci 62 000 tokenów narzutu. Płaci 6,2 miliona.
To 18,60 USD wydane dosłownie na nic produktywnego. Agent mógłby przespać całą noc, nie dotykając ani jednego narzędzia GitHub. Mógłby pracować wyłącznie na lokalnych plikach. Ty i tak zostajesz obciążony za wszystkie 26 definicji narzędzi GitHub przy każdym z tych 2 000 kroków, ponieważ zostały one zarejestrowane w sesji.
Kluczową kwestią, którą należy przyswoić, jest to, że płacisz za zarejestrowane narzędzia, a nie za wywołane narzędzia. Model nie sprawdza, których narzędzi faktycznie używa, aby następnie obniżyć Twój rachunek. Jeśli serwer jest połączony, jego pełny manifest jest wprowadzany ponownie do kontekstu w każdym cyklu. Jest to podatek od potencjału, a nie od działania, naliczany przy każdym kroku.
Dla programistów uruchamiających iteracyjne agenty kodujące, środowiska testowe lub zadania przeglądu wsadowego, jest to cichy zabójca budżetu. Ludzka rozmowa składająca się z 20 kroków jest lekka. Pętla agentowa składająca się z 200 lub 2 000 kroków to moment, w którym matematyka staje się dotkliwa.
Jak utrzymać koszty pod kontrolą
MCP jest naprawdę użyteczne. Powinieneś z niego korzystać. Ale traktuj go jak narzędzie, które włączasz do konkretnego zadania, a nie jak stały element, który przytwierdzasz do każdej sesji.
Dostosuj konfiguracje do projektu i zadania
Nie ładuj domyślnie każdego serwera do swojej globalnej konfiguracji Claude Code. Twórz konfiguracje MCP o zakresie projektu, które odpowiadają pracy, którą faktycznie wykonujesz. Jeśli refaktoryzujesz lokalny moduł, prawdopodobnie potrzebujesz serwera filesystem i niczego więcej. Jeśli zajmujesz się segregowaniem błędów (triage), załaduj serwer GitHub tylko do tego konkretnego zadania i rozłącz go, gdy wrócisz do lokalnego programowania.
Pomyśl o tym jak o pozostawianiu otwartych aplikacji w telefonie. Jedna lub dwie to nie problem. Dwadzieścia działających w tle niepotrzebnie drenuje baterię.
Wybieraj serwery z mniejszą liczbą narzędzi
Not all MCP servers are designed with the same discipline. Some expose a lean interface of two or three focused actions. Others ship a sprawling catalog of 25 or 30 tools, many of which you will never invoke. A server with three tools might cost you 180 tokens per turn. One with 26 tools can cost 3,100. That is a 17x jump in overhead for a capability gap that may not matter to you.
Before installing a server, look at its tool manifest. If it registers a dozen overlapping operations and you only need one, consider whether you can configure it down, fork it, or write a slimmer wrapper. Every tool definition you can strip out is a direct and permanent token saving on every future turn.
Trim Tool Descriptions
The 80 to 150 token range per tool is not a law of nature. It is a function of how verbose the descriptions and schemas are. A bloated 400-token description eats five times the context of an 80-token description, and that fivefold penalty applies on every single turn.
Audit the servers you rely on. If a tool description reads like marketing copy, rewrite it. Cut adjectives. Cut examples that do not clarify the schema. Tighten the JSON. The model needs to understand what the tool does, but it does not need a paragraph of preamble. Treat tool definitions like code: the shorter and clearer, the better.
The Real Takeaway
MCP extends what Claude Code can reach. It does not extend your context window for free. The overhead is deterministic, recurring, and entirely disconnected from whether the tools see action.
Load only the servers your current task demands. Disconnect them when you are done. Audit tool counts and description lengths like you would audit any other dependency. The rule is simple: if the tool is not adding value in this specific session, it should not be adding tokens to your bill.
Source measurements and methodology: I added MCP servers to Claude Code — here’s what they cost in tokens
Join the GyaanSetu AI learning community for more engineering breakdowns: t.me/GyaanSetuAi
