Claude Opus 5 kosztuje teraz trzy razy więcej niż Opus 4.8 przy tym samym obciążeniu, mimo że oba modele mają tę samą cenę za token. Winowajcą jest domyślna funkcja „adaptive thinking”, która po cichu zużywa tokeny wyjściowe jako ukryte rozumowanie. Wyłączenie tej funkcji przywraca parytet kosztów bez wpływu na dokładność.

Dlaczego pojawia się różnica w cenie

Obie wersje naliczają 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. W naszych benchmarkach rachunek za Opus 5 był 3,1-krotnie wyższy niż za Opus 4.8 przy uruchamianiu identycznych promptów. Dodatkowa opłata nie wynika z wyższej ceny katalogowej; jest ona wpisana w sposób, w jaki Opus 5 rozlicza swój wewnętrzny proces myślowy.

Co robi adaptive thinking

Gdy funkcja adaptive thinking jest włączona, model wykonuje dodatkowe wewnętrzne rozumowanie przed wygenerowaniem ostatecznej odpowiedzi. To rozumowanie jest liczone jako tokeny wyjściowe, mimo że nigdy nie dociera do użytkownika. W przypadku prostych zapytań od 42% do 95% fakturowanych tokenów wyjściowych stanowi to ukryte rozumowanie. Prosty problem arytmetyczny, który powinien przynieść jednocyfrową odpowiedź, może zatem wygenerować dziesiątki niewidocznych tokenów, drastycznie zwiększając koszty.

Funkcja ta nie jest błędem – projektanci Claude mają na celu poprawę jakości odpowiedzi w złożonych zadaniach. W praktyce ukryte rozumowanie często przynosi skromne zyski w dokładności przy trudnych promptach, zwłaszcza gdy model musi łączyć wiele kroków lub wchodzić w interakcję z zewnętrznymi narzędziami.

Jak kontrolować koszty

Model przyjmuje pojedynczy parametr, który wyłącza adaptive thinking:

{
  "thinking": {"type": "disabled"}
}

Zastosowanie tego ustawienia w Opus 5 obniża koszt pojedynczego zadania dokładnie do poziomu, który nalicza Opus 4.8, podczas gdy poprawność wyników pozostaje taka sama w przypadku prostych obciążeń, które testowaliśmy.

Kiedy wyłączyć

  • Ekstrakcja danych z tekstu
  • Operacje formatowania (np. konwersja JSON)
  • Wywołania jednokrokowe, gdzie odpowiedź jest bezpośrednim wyszukaniem lub trywialnym obliczeniem

Wyłączenie myślenia w tych przypadkach eliminuje „podatek od ukrytych tokenów” i sprawia, że rachunki są przewidywalne.

Kiedy zostawić włączone

  • Zadania wymagające głębokich łańcuchów logicznych lub niuansowego rozumowania
  • Przepływy pracy agentów (agent workflows), które wielokrotnie wywołują zewnętrzne narzędzia

W scenariuszach intensywnie korzystających z narzędzi różnica w kosztach zmniejsza się do około 33%, ponieważ model wydaje mniej na wewnętrzne rozumowanie podczas przechodzenia przez pętle wywołań narzędzi.

Inne istotne różnice

  • Okno kontekstowe: Opus 5 może pomieścić do miliona tokenów, co zweryfikowaliśmy, odzyskując docelowy ciąg znaków umieszczony na 969 950. tokenie.
  • Próg cache: Minimalny rozmiar cache spadł do 512 tokenów, czyli połowy progu Opus 4.8, co wpływa na to, jak dużą część poprzedniej rozmowy model może ponownie wykorzystać bez ponownego tokenizowania.

Na co zwrócić uwagę w przyszłości

Deweloperzy powinni monitorować raporty użycia pod kątem „reasoning tokens” lub podobnych pozycji, które wskazują na aktywność adaptive thinking. W miarę jak coraz więcej aplikacji wykorzystuje Claude do operacji typu agent, kompromis między kosztem a jakością stanie się kluczową decyzją optymalizacyjną. Przyszłe aktualizacje mogą pozwolić użytkownikom na dostrajanie głębokości rozumowania zamiast przełącznika typu „wszystko albo nic”, co mogłoby wygładzić krzywą kosztów.

Podsumowanie: Domyślne adaptive thinking w Opus 5 zwiększa zużycie tokenów w łatwych zadaniach. Wyłącz je za pomocą prostego ustawienia powyżej, aby dopasować koszty do Opus 4.8, i włączaj je tylko wtedy, gdy dodatkowe rozumowanie uzasadnia dodatkowe wydatki.