Bash-Wrapper verbrauchten in einem Durchlauf mit 12 Fragen mehr Token als das sieben-Schema Model Context Protocol (MCP), was zeigt, dass die Shell nicht die kostengünstige Abkürzung ist, die viele Ingenieure vermuten. Der Token-Verbrauch schlägt sich bei Large-Language-Model (LLM)-Agenten, die in großem Maßstab eingesetzt werden, direkt in Kosten nieder.
Das Experiment, das alles auf den Kopf stellte
Ein Entwickler untersuchte vier Möglichkeiten, wie ein LLM-Agent Schiffsdaten abrufen konnte:
- MCP – sieben Tool-Schemas, die über das Model Context Protocol bereitgestellt werden.
- Bash + curl (cold) – ein roher Shell-Aufruf ohne zusätzliche Prompts.
- Bash + curl (warm) – derselbe Shell-Aufruf plus System-Prompts, die eine sichere Nutzung gewährleisten.
- Dediziertes CLI-Tool – eine zweckgebundene Kommandozeilenschnittstelle.
Alle vier Varianten wurden in einem Gespräch mit 12 Anfragen getestet. Der Token-Verbrauch, der die API-Rechnungen bestimmt, ergab folgendes Ergebnis:
- MCP: 109.779 Token
- Bash + curl (cold): 158.021 Token
- Bash + curl (warm): 178.577 Token
Die Zahlen für das dedizierte CLI-Tool wurden nicht veröffentlicht, aber die beiden Bash-Varianten waren bereits teurer als MCP.
Warum die Shell mehr kostete als das Protokoll
Jedes Bash-Tool benötigte etwa 2.700 Token an „Harness-Prompts“ – also Anweisungen, die dem Agenten mitteilen, wie er die Shell sicher aufruft, Ausgaben parst und Fehler behandelt. Diese Prompts allein übersteigen das gesamte Token-Gewicht aller sieben MCP-Schemas zusammen.
Die Kosten entstehen nicht nur beim initialen Aufruf. In der Produktion lud derselbe Agent beim Start 11 MCP-Server vorab, was 19.800 Token verbrauchte, noch bevor die erste Benutzeranfrage eintraf. Bei jedem weiteren Schritt las der Agent dann jedes Schema von jedem Server erneut ein, sodass selbst eine triviale Anfrage wie „Wie spät ist es?“ den Token-Preis jeder anderen Tool-Beschreibung mitbezahlte.
Die versteckte Belastung durch Eager Loading
Wenn ein LLM-Agent bei jedem Schritt (Turn) jeden Tool-Server sofort lädt (Eager Loading), bläht sich die Token-Rechnung dramatisch auf. Das Experiment zeigte, dass die „echten“ Kosten der Nutzung von Bash nicht der Shell-Befehl selbst sind, sondern der umgebende Kontext, der jedes Mal an das Modell übertragen werden muss.
- Tools mit Fixkosten (MCP-Schemas) verursachen einen vorhersehbaren Token-Overhead pro Schritt.
- Dynamische Payloads (curl-Antworten) verursachen eine wachsende Last, die mit der Gesprächslänge und der Datengröße skaliert.
Somit erlegt eine Shell, die oberflächlich betrachtet „kostenlos“ erscheint, tatsächlich eine größere, variable Token-Steuer auf.
Was KI-Ingenieure als Nächstes tun sollten
- Lazy Loading einführen. Laden Sie einen Tool-Server erst dann, wenn sein Schema tatsächlich benötigt wird, und halten Sie ihn über mehrere Schritte hinweg im Speicher, anstatt ihn jedes Mal neu einzulesen.
- Tool-Schemas als feste Kosten pro Schritt behandeln. Planen Sie Token-Budgets basierend auf der bekannten Größe der MCP-Definitionen, anstatt davon auszugehen, dass Shell-Befehle kostenlos sind.
- Die Annahme „Shell = günstig“ überdenken. Analysieren Sie den Token-Verbrauch für jeden Tool-Pfad, bevor Sie sich für ein Design entscheiden.
- Strukturierte Tools für kleine Modelle nutzen. Selbst bei begrenzten Kontextfenstern verbessern gut definierte Schemas das logische Denken, die Einheitenumrechnung und die Fehlerbehandlung.
Das Fazit: Nicht das Protokoll-Design, sondern die Token-Ökonomie bestimmt die Kosten. Die Steuerung dessen, wann und wie Tool-Server geladen werden, kann zehntausende Token pro Gespräch einsparen und so die Betriebskosten direkt senken.
Source: https://dev.to/clarkbw--/enabling-bash-costs-more-context-than-seven-mcp-tool-schemas-2h82
