Claude Opus 5 kostet nun das Dreifache von Opus 4.8 für dieselbe Arbeitslast, obwohl beide Modelle denselben Preis pro Token angeben. Der Übeltäter ist die standardmäßig aktivierte Funktion „adaptive thinking“, die im Hintergrund Output-Token als verborgenes Reasoning verbraucht. Das Deaktivieren dieser Funktion stellt die Kostengleichheit wieder her, ohne die Genauigkeit zu beeinträchtigen.

Warum die Preisdifferenz entsteht

Beide Versionen berechnen 5 $ pro Million Input-Token und 25 $ pro Million Output-Token. In unseren Benchmarks war die Rechnung für Opus 5 bei identischen Prompts 3,1-mal höher als die von Opus 4.8. Der Aufpreis resultiert nicht aus einem höheren Listenpreis; er ist in der Art und Weise verankert, wie Opus 5 seinen internen Denkprozess abrechnet.

Was „adaptive thinking“ bewirkt

Wenn „adaptive thinking“ aktiviert ist, führt das Modell vor der Ausgabe der endgültigen Antwort zusätzliche interne Überlegungen durch. Dieses Reasoning wird als Output-Token gezählt, erreicht den Nutzer jedoch nie. Bei einfachen Abfragen machen diese verborgenen Überlegungen zwischen 42 % und 95 % der abgerechneten Output-Token aus. Ein einfaches Rechenproblem, das eigentlich nur eine einstellige Antwort liefern sollte, kann daher Dutzende unsichtbarer Token erzeugen, was die Kosten drastisch in die Höhe treibt.

Die Funktion ist kein Fehler – die Entwickler von Claude haben sie entwickelt, um die Antwortqualität bei komplexen Aufgaben zu verbessern. In der Praxis bringen die verborgenen Überlegungen oft nur moderate Genauigkeitsgewinne bei schwierigen Prompts, insbesondere wenn das Modell mehrere Schritte verketten oder mit externen Tools interagieren muss.

So kontrollieren Sie die Kosten

Das Modell akzeptiert einen einzelnen Parameter, um „adaptive thinking“ zu deaktivieren:

{
  "thinking": {"type": "disabled"}
}

Die Anwendung dieser Einstellung auf Opus 5 senkt die Kosten pro Aufgabe exakt auf das Niveau von Opus 4.8, während die Korrektheit der Ergebnisse bei den von uns getesteten einfachen Arbeitslasten gleich bleibt.

Wann man es deaktivieren sollte

  • Extraktion von Daten aus Texten
  • Formatierungsoperationen (z. B. JSON-Konvertierung)
  • Einzelschritt-Aufrufe, bei denen die Antwort ein direkter Abruf oder eine triviale Berechnung ist

Das Deaktivieren des Denkprozesses in diesen Fällen eliminiert die „versteckte Token-Steuer“ und sorgt für kalkulierbare Kosten.

Wann man es aktiviert lassen sollte

  • Aufgaben, die tiefe logische Ketten oder nuanciertes Reasoning erfordern
  • Agenten-Workflows, die wiederholt externe Tools aufrufen

In Tool-intensiven Szenarien verringert sich die Preisdifferenz auf etwa 33 %, da das Modell weniger für internes Reasoning aufwendet, während es Tool-Aufrufe in einer Schleife durchläuft.

Weitere nennenswerte Unterschiede

  • Kontextfenster: Opus 5 kann bis zu eine Million Token halten, was wir durch das Abrufen eines Zielstrings verifiziert haben, der an Position 969.950 platziert wurde.
  • Cache-Untergrenze: Die minimale Cache-Größe sank auf 512 Token, die Hälfte der Untergrenze von Opus 4.8, was beeinflusst, wie viel der vorherigen Konversation das Modell ohne erneutes Tokenisieren wiederverwenden kann.

Worauf man als Nächstes achten sollte

Entwickler sollten Nutzungsberichte auf „Reasoning Tokens“ oder ähnliche Posten überwachen, die darauf hinweisen, dass „adaptive thinking“ aktiv ist. Da immer mehr Anwendungen Claude für Agenten-ähnliche Operationen nutzen, wird die Abwägung zwischen Kosten und Qualität zu einer entscheidenden Optimierungsentscheidung. Zukünftige Updates könnten es Nutzern ermöglichen, die Tiefe des Reasonings einzustellen, anstatt nur einen Alles-oder-Nichts-Schalter zu haben, was die Kostenkurve glätten könnte.

Fazit: Das standardmäßige „adaptive thinking“ von Opus 5 treibt den Token-Verbrauch bei einfachen Aufgaben in die Höhe. Deaktivieren Sie es mit der oben genannten einfachen Einstellung, um die Kosten von Opus 4.8 zu erreichen, und aktivieren Sie es nur dann, wenn das zusätzliche Reasoning die Mehrkosten rechtfertigt.