Anthropic представляє Claude Opus 5: елітна продуктивність за пів ціни

Anthropic офіційно запустила Claude Opus 5 — нову флагманську модель, розроблену, щоб змінити правила гри на ринку високопродуктивних LLM, пропонуючи рівень можливостей, майже ідентичний преміальній Claude Fable 5, але за значно нижчою ціною. Цей стратегічний крок має на меті нейтралізувати ціновий тиск з боку таких конкурентів, як GPT-5.6 Sol, водночас надаючи розробникам ефективніший інструмент для програмування та складної інтелектуальної роботи.

Злам межі співвідношення ціни та продуктивності

Найбільш вражаючою особливістю Claude Opus 5 є її агресивна структура ціноутворення. У той час як топова Claude Fable 5 коштує $10 за мільйон вхідних токенів і $50 за мільйон вихідних токенів, Opus 5 скорочує ці тарифи вдвічі: $5 за мільйон вхідних і $25 за мільйон вихідних токенів.

Щоб задовольнити вимоги щодо затримки (latency), Anthropic також представила «Fast Mode», який збільшує швидкість обробки у 2,5 раза, хоча це призводить до подвоєння ціни за токен. Таке багаторівневе ціноутворення у поєднанні з величезним контекстним вікном у 1 мільйон токенів робить Opus 5 новою моделлю за замовчуванням для Claude Max і найпотужнішим варіантом для користувачів Claude Pro.

Перевага в бенчмарках: програмування та міркування

Opus 5 — це не просто бюджетна альтернатива; це справжній потужний інструмент у певних доменах. В агентному термінальному програмуванні за допомогою Frontier-Bench v0.1 Opus 5 досягла результату 43,3%, значно перевершивши як Fable 5 (33,7%), так і GPT-5.6 Sol (34,4%). Вона також продемонструвала домінування в інтелектуальній роботі, очоливши бенчмарк GDPval-AA v2 з показником Elo 1 861.

Мабуть, найбільш приголомшлива статистика стосується бенчмарка ARC-AGI-3, який вимірює здатність до вирішення нових завдань. Opus 5 набрала 30,2%, що майже в чотири рази перевищує результат GPT-5.6 Sol (7,8%). Це свідчить про величезний стрибок у здатності моделі справлятися із завданнями, які виходять за межі шаблонів її навчальних даних.

Інтелектуальне масштабування зусиль та ефективність

Anthropic представила складну систему «зусиль» (effort), яка дозволяє користувачам перемикатися між п'ятьма налаштуваннями: low, medium, high, xhigh та max. Це забезпечує можливість гнучко балансувати між споживанням токенів і глибиною міркувань.

Хоча Anthropic рекомендує налаштування «low» та «medium» для загальних завдань з метою оптимізації витрат, для складного агентного програмування вони радять використовувати «xhigh». Цікаво, що компанія відзначила зменшення ефективності при налаштуванні «max»: як у Frontier-Bench v0.1, так і в Artificial Analysis Coding Agent Index, Opus 5 фактично продемонструвала невелике зниження продуктивності при максимальних зусиллях, попри вищу вартість. Це свідчить про те, що налаштування «xhigh» наразі є оптимальним варіантом для досягнення ефективності.

Покращена безпека та автономність

У відповідь на відгуки користувачів Anthropic доопрацювала класифікатори безпеки для Opus 5. Кіберфільтри моделі спрацьовують приблизно на 85% рідше, ніж у Fable 5, що вирішує попередні зауваження щодо надмірно ретельного блокування легітимних досліджень. Хоча модель усе ще запобігає генерації експлойтів та скануванню на основі бінарних файлів, вона стала набагато лояльнішою до досліджень вразливостей вихідного коду.

Крім того, Opus 5 демонструє покращені можливості самокорекції. Під час реального тестування модель успішно побудувала 3D-модель у FreeCAD, написавши власний конвеєр (pipeline) комп'ютерного зору для інтерпретації геометрії — завдання, з яким не впоралися всі інші моделі-конкуренти.

Основні висновки

  • Різке зниження вартості: Opus 5 пропонує продуктивність флагманського рівня за 50% вартості токенів Claude Fable 5.
  • Прорив у міркуваннях: Модель продемонструвала величезну 4-кратну перевагу над конкурентами в бенчмарку ARC-AGI-3 для вирішення нових завдань.
  • Оптимізований робочий процес розробника: Завдяки покращеним класифікаторам безпеки та спеціалізованим налаштуванням «effort», Opus 5 забезпечує більш плавний досвід для агентного програмування та досліджень.