Anthropic Claude Opus 5 кидає виклик Fable 5 завдяки вищій ефективності

Anthropic офіційно увійшла в нову еру передового моделювання з релізом Claude Opus 5 — моделі, що обіцяє інтелект високого рівня за значно нижчою ціною, ніж її основні конкуренти. Порівнюючи показники або перевершуючи Claude Fable 5 та GPT-5.6 Sol у кількох критичних тестах, Opus 5 змінює економіку передового ШІ-міркування.

Домінування у програмуванні та інтелектуальній роботі

Claude Opus 5 зарекомендувала себе як потужний інструмент у спеціалізованих галузях, зокрема у програмній інженерії та автоматизації офісних процесів. В Artificial Analysis Intelligence Index — комплексному метричному показнику, що охоплює програмування, наукове мислення та фактичну точність — Opus 5 здобула провідний результат 61, випередивши Claude Fable 5 (60) та GPT-5.6 Sol (59).

У сфері автономної інженерії Opus 5 у поєднанні з Claude Code ділить перше місце в Coding Agent Index із 67 балами. Вона також продемонструвала вражаючі 89% у Terminal-Bench v2.1, зрівнявшись із попереднім лідером галузі, GPT-5.6 Sol. Крім того, модель демонструє безпрецедентне домінування в офісних завданнях. В бенчмарку AA-Briefcase, який оцінює дослідження, презентації та аналіз електронних таблиць, Opus 5 досягла рейтингу Elo 1720, випередивши Fable 5 на 146 пунктів.

Парадокс ефективності: чому «high» краще за «max»

Одним із найважливіших відкриттів для розробників є зв'язок між рівнями міркування та реальною користю. Хоча Anthropic пропонує рівні від «low» до «max», дані свідчать про те, що найвищі рівні міркування не завжди є найефективнішими для практичного впровадження.

Тестування Vals.ai через Vibe Code Bench показало, що хоча продуктивність зростає разом зі складністю, рівень «high» часто видає надійніші та простіші рішення. Натомість рівні «max» та «xhigh» схильні генерувати складніші рішення, які можуть містити помилки. Це також спостерігається в Terminal-Bench 2.1, де рівень «high» перевершує «max», оскільки останній витрачає занадто багато часу на окремі спроби, часто вичерпуючи ліміт часу до завершення завдання. Для більшості виробничих сценаріїв рівень «high» є оптимальним балансом надійності та економічної ефективності.

Економічно вигідний передовий інтелект

Найбільш революційним аспектом Claude Opus 5 є структура ціноутворення відносно рівня інтелекту. У завданнях AA-Briefcase Opus 5 з рівнем міркування «max» коштує приблизно $17,79 за завдання, що на 20% менше, ніж $22,30 у Fable 5. Для користувачів, які обирають рівень «high», вартість падає до всього $10,41 — це менше половини вартості конкурента, при цьому модель зберігає вищі рейтинги Elo.

Anthropic зберегла конкурентну модель ціноутворення за токенами:

  • Вхідні токени (Input tokens): $5 за мільйон
  • Вихідні токени (Output tokens): $25 за мільйон
  • Попадання в кеш (Cache hits): $0,50 за мільйон токенів

Звуження кордонів передових технологій

Попри успіхи, Opus 5 не позбавлена недоліків. Фактична точність залишається проблемою: у бенчмарку AA-Omniscience модель поступається Fable 5, а рівень її галюцинацій зріс до 50%, оскільки вона намагається давати відповіді частіше, навіть коли не впевнена.

Незначна різниця між Opus 5, Fable 5 та серією GPT-5 підкреслює стрімке дозрівання ринку. Оскільки розрив у продуктивності в науковому мисленні та програмуванні скорочується, індустрія ШІ рухається до періоду коммодитизації, де основними факторами розрізнення стануть ефективність, вартість та інтеграція у спеціалізовані робочі процеси.

Основні висновки

  • Передова спеціалізована продуктивність: Opus 5 лідирує в інтелектуальній роботі (рейтинг Elo 1720 в AA-Briefcase) і ділить перше місце в бенчмарках для агентів програмування.
  • Оптимізовані рівні міркування: Рівень міркування «high» визначено як найбільш надійне та економічно вигідне налаштування для завдань програмування та роботи з терміналом, яке часто перевершує рівень «max».
  • Революційна юніт-економіка: Opus 5 забезпечує інтелект передового рівня за значно нижчою вартістю за завдання порівняно з Claude Fable 5.