Claude Opus 5 тепер коштує втричі дорожче за Opus 4.8 при однаковому навантаженні, хоча обидві моделі мають однакову ціну за токен. Причиною є функція «adaptive thinking» за замовчуванням, яка непомітно споживає вихідні токени як приховані міркування. Вимкнення цієї функції відновлює паритет витрат без втрати точності.
Чому виникає розрив у ціні
Обидві версії стягують $5 за мільйон вхідних токенів і $25 за мільйон вихідних токенів. У наших бенчмарках рахунок Opus 5 був у 3,1 раза вищим за Opus 4.8 при виконанні ідентичних запитів. Додаткова плата не пов'язана з вищою базовою ціною; вона закладена в те, як Opus 5 обліковує свій внутрішній процес мислення.
Що робить adaptive thinking
Коли функція adaptive thinking увімкнена, модель виконує додаткові внутрішні міркування перед видачею остаточної відповіді. Ці міркування враховуються як вихідні токени, хоча користувач їх ніколи не бачить. У простих запитах від 42% до 95% виставлених у рахунок вихідних токенів складають ці приховані міркування. Таким чином, проста арифметична задача, яка має дати одноцифровий результат, може згенерувати десятки невидимих токенів, що різко збільшує вартість.
Ця функція — не помилка; розробники Claude створили її для підвищення якості відповідей у складних завданнях. На практиці приховані міркування часто дають помірне підвищення точності у складних запитах, особливо коли моделі потрібно виконувати послідовність кроків або взаємодіяти із зовнішніми інструментами.
Як контролювати витрати
Модель приймає один параметр, який вимикає adaptive thinking:
{
"thinking": {"type": "disabled"}
}
Застосування цього налаштування до Opus 5 знижує витрати на кожне завдання до рівня Opus 4.8, при цьому точність результатів на простих завданнях, які ми тестували, залишається незмінною.
Коли варто вимкнути
- Вилучення даних із тексту
- Операції форматування (наприклад, конвертація в JSON)
- Однокрокові виклики, де відповідь є прямим пошуком або тривіальним обчисленням
Вимкнення мислення в цих випадках усуває «податок» на приховані токени та робить рахунки передбачуваними.
Коли варто залишити увімкненим
- Завдання, що потребують глибоких логічних ланцюжків або нюансованого мислення
- Робочі процеси агентів, які неодноразово викликають зовнішні інструменти
У сценаріях з інтенсивним використанням інструментів розрив у вартості звужується приблизно до 33%, оскільки модель витрачає менше на внутрішні міркування під час циклічних викликів інструментів.
Інші помітні відмінності
- Контекстне вікно: Opus 5 може вміщувати до одного мільйона токенів, що ми перевірили, отримавши цільовий рядок, розміщений на позначці 969 950 токенів.
- Мінімальний розмір кешу: Мінімальний розмір кешу знизився до 512 токенів (половина від показника Opus 4.8), що впливає на те, яку частину попередньої розмови модель може повторно використовувати без повторної токенізації.
На що звернути увагу далі
Розробникам слід стежити за звітами про використання на наявність «reasoning tokens» (токенів міркування) або подібних позицій, які вказують на те, що adaptive thinking активна. Оскільки все більше застосунків використовують Claude для агентських операцій, компроміс між вартістю та якістю стане ключовим рішенням при оптимізації. Майбутні оновлення можуть дозволити користувачам налаштовувати глибину мислення замість перемикача «все або нічого», що допоможе згладити криву витрат.
Висновок: Adaptive thinking за замовчуванням у Opus 5 збільшує використання токенів у простих завданнях. Вимкніть її за допомогою простого налаштування вище, щоб досягти вартості Opus 4.8, і вмикайте її лише тоді, коли додаткові міркування виправдовують додаткові витрати.
