Anthropics neuer Beta-Header reduziert die Token-Kosten für Tool-Aufrufe bei Claude 3.7 Sonnet um etwa 14 Prozent, was KI-Agenten eine moderate Senkung ihrer monatlichen Kosten und einen kleinen Latenzvorteil verschafft.

Warum die Tool-Nutzung Token verbraucht

Jeder Schritt, den ein Agent mit Claude unternimmt, umfasst drei tokenbasierte Phasen:

  • Tool-Definitionen – die Namen und JSON-Schemas, die Sie als Teil des Prompts senden.
  • Tool-Aufrufe – die strukturierte Ausgabe, die das Modell generiert, wenn es sich entscheidet, ein Tool aufzurufen.
  • Tool-Ergebnisse – die Daten, die Ihr Code an das Modell zurückgibt.

Der erste und der dritte Schritt sind Input-Token; der zweite Schritt sind Output-Token. Da Claude für Output mehr berechnet als für Input, kann das Reduzieren von Output-Token die Kosten senken, selbst wenn die Gesamtzahl der Token ähnlich bleibt.

Der Beta-Header

Anthropic hat ein Beta-Feature namens token-efficient tool use angekündigt. Das Hinzufügen des HTTP-Headers

anthropic-beta: token-efficient-tools-2025-02-19

aktiviert die Optimierung, jedoch nur, wenn die Anfrage an Claude 3.7 Sonnet gerichtet ist. Wenn der Header an ein anderes Modell gesendet wird, wird die Anfrage unverändert verarbeitet; der Header wird ohne Fehlermeldung ignoriert.

Die Optimierung funktioniert durch die Komprimierung der Tool-Call-Ausgabe des Modells, wodurch die Anzahl der Output-Token für diesen Schritt um etwa 14 Prozent reduziert wird.

Wie viel Sie tatsächlich sparen

Output-Token sind teurer als Input-Token, daher führt eine 14-prozentige Kürzung in diesem Bereich nicht zu einem proportionalen Rückgang der Gesamtrechnung. In einer typischen vierstufigen Agenten-Schleife dominieren Tool-Definitionen oft die Input-Kosten und machen manchmal mehr als die Hälfte der verwendeten Token aus. Unter diesen Bedingungen führt die 14-prozentige Ersparnis bei den Output-Token in der Regel nur zu einer Reduzierung der Gesamtkosten um etwa 3 Prozent.

Die in der Schlagzeile genannte Ersparnis wirkt daher bescheiden, aber die Änderung verursacht keine zusätzlichen Kosten und bietet einen leichten Latenzvorteil: Weniger Output-Token bedeuten, dass das Modell die Generierung einen Bruchteil schneller abschließt.

Größere Einsparungen erfordern andere Taktiken

Wenn das Ziel darin besteht, die Ausgaben sinnvoll zu begrenzen, wird der Header allein nicht ausreichen. Drei praktische Hebel ermöglichen größere Einsparungen:

  • Prompt Caching – Speichern Sie die Tool-Definitionen einmal und verwenden Sie die gecachte Version bei nachfolgenden Aufrufen wieder. Gecachte Lesezugriffe werden zu einem niedrigeren Satz abgerechnet als neue Input-Token.
  • Tool-Set reduzieren – Beziehen Sie nur Tools ein, die für die aktuelle Aufgabe essenziell sind. Jedes zusätzliche Tool fügt seine Definition jeder Anfrage hinzu, was die Input-Kosten in die Höhe treibt.
  • Tool-Ergebnisse ausdünnen – Geben Sie nur die Felder zurück, die das Modell tatsächlich benötigt. Große API-Antworten, die in das Gespräch zurückgeführt werden, blähen sowohl die Input-Token als auch den Gesprächsverlauf auf.

Die Anwendung dieser Praktiken kann einen spürbaren Teil der Gesamtausgaben einsparen, weit über die 3 Prozent hinaus, die man allein durch die Beta erzielen würde.

Worauf man achten sollte

Anthropic hat nicht angegeben, wann – oder ob – der token-effiziente Modus vom Beta-Status in ein Standard-Feature übergeht. Entwickler sollten zukünftige Ankündigungen im Auge behalten, die möglicherweise die Unterstützung über Claude 3.7 Sonnet hinaus erweitern oder tiefere Token-Komprimierungstechniken einführen. Die Überwachung der Token-Aufschlüsselung pro Anfrage wird zudem helfen, die Auswirkungen in der Praxis zu quantifizieren, während sich die Nutzungsmuster entwickeln.

Fazit

Der Beta-Header ist eine kostenlose, mühelose Anpassung, die die Output-Token für Tool-Aufrufe um etwa 14 Prozent reduziert, was zu einer moderaten Senkung der Rechnung und einem minimalen Geschwindigkeitsvorteil führt. Für alle, die bereits mit hohen Agenten-Kosten zu kämpfen haben, ist der Header eine hilfreiche Ergänzung, aber echte Einsparungen werden durch Prompt-Caching, die Begrenzung der Tool-Nutzung und die Rückgabe schlankerer Ergebnisse erzielt.

Quelle: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l