Claude Code verbringt drei Viertel seines Token-Budgets allein mit dem Lesen der Codebasis, wie eine Analyse von Red Hat aus 219 realen Sitzungen zeigt. Dieser Befund kehrt die übliche Annahme um, dass KI-gesteuerte Coding-Agenten Zeit mit der Generierung von Code verschwenden, und legt nahe, dass Entwickler das Problem des Kontextmanagements angehen sollten, anstatt nur die Modellgeschwindigkeit zu optimieren.
Die Daten hinter der Behauptung
Red Hat untersuchte 219 Interaktionen mit Anthropic’s Claude Code und berechnete den Token-Verbrauch pro Durchgang. In der Stichprobe wurden im Median 75 % der Token für die Aufnahme der umgebenden Codebasis und der Dokumentation aufgewendet, während nur 25 % in die Erzeugung neuer Zeilen flossen. Da die meisten KI-Anbieter Input- und Output-Token zum gleichen Satz berechnen, treibt die „lesende“ Hälfte der Transaktion den Großteil der Kosten.
Warum die Lesekosten entscheidend sind
Optimierungsstrategie
Viele Teams investieren Ressourcen in schnellere oder größere Modelle, in der Hoffnung, dass ein Geschwindigkeitsschub die Zeit pro Generierung verkürzt. Wenn drei Viertel der Arbeit lediglich darin bestehen, Kontext abzurufen, spart ein schnelleres Modell nur einen Bruchteil der Gesamtzeit. Der eigentliche Hebel ist die Menge an Kontext, die das Modell pro Durchgang verarbeiten muss.
Kostenkontrolle
Wenn ein KI-Assistent bei jeder Anfrage denselben Repository-Zustand erneut liest, blähen sich die Input-Token auf. Projekte mit großen Kontextfenstern können einen drastischen Anstieg ihrer Rechnungen erleben, selbst wenn die Menge des generierten Codes moderat bleibt.
Engineering-Fokus
Werkzeugentwickler streben oft nach höherer Modellqualität, während sie übersehen, wie Prompts konstruiert werden. Die Analyse legt nahe, dass „Context Engineering“ – das Kürzen, Cachen und Zusammenfassen des an das Modell übergebenen Codes – einen größeren ROI liefert als inkrementelle Modell-Upgrades.
Praktische Schritte zur Reduzierung des Lese-Overheads
- Irrelevante Dateien aussortieren – Entfernen Sie Dateien aus dem Prompt, die für die aktuelle Aufgabe nicht benötigt werden. Kleinere Prompts bedeuten weniger Input-Token.
- Wiederholte Lesezugriffe zwischenspeichern (Cachen) – Speichern Sie die Interpretation des Modells von stabilen Teilen der Codebasis und verwenden Sie diese über die Durchgänge hinweg wieder, anstatt denselben Text erneut zu senden.
- Tool-Ausgaben komprimieren – Wenn externe Tools große Blobs zurückgeben (z. B. Lint-Berichte), fassen Sie diese zusammen, bevor Sie sie an Claude zurückgeben.
- Inkrementelle Diffs verwenden – Senden Sie nur die Änderungen seit dem letzten Durchgang anstatt des gesamten Dateiinhalts.
Diese Taktiken zielen darauf ab, zu verhindern, dass die KI bei jeder Interaktion denselben Repository-Snapshot erneut liest, wodurch sowohl die Latenz als auch die Kosten gesenkt werden.
Gegenargument: Geschwindigkeit zählt immer noch
Einige Entwickler argumentieren, dass ein schnelleres Modell dennoch wichtig ist, da es die Latenz der 25 % der Token reduziert, die tatsächlich generiert werden. In latenzempfindlichen Umgebungen – wie etwa IDE-Plugins, die sofort reagieren müssen – zählt jede Millisekunde. Das lese-dominante Profil eliminiert den Vorteil eines schnelleren Modells nicht; es reduziert lediglich dessen relativen Einfluss.
Worauf man als Nächstes achten sollte
Die Studie von Red Hat basiert auf einem begrenzten Satz von Sitzungen, daher könnte eine breitere Stichprobe andere Token-Verteilungen für andere Sprachen oder Projektgrößen offenbaren. Wenn zukünftige Daten die 75 %-Lesequote bestätigen, könnten wir einen Trend hin zu Werkzeugen sehen, die Kontext automatisch kürzen und cachen, oder sogar zu Modellarchitekturen, die auf eine schnelle Kontextaufnahme optimiert sind.
Fazit: Bei KI-gestütztem Coding erzielt man den kostengünstigsten Performance-Gewinn, indem man dem Modell weniger Informationen liefert, anstatt es schneller schreiben zu lassen. Die Zahlen von Red Hat sprechen eine klare Sprache: Kürzen, cachen und fassen Sie Ihre Prompts zusammen, und Sie werden spürbare Einsparungen bei Zeit und Kosten erzielen.
