OpenAI объявила, что её модель GPT-5.6 Sol набрала 38,3% в логическом бенчмарке ARC-AGI-3, опередив Claude Opus 5 от Anthropic, результат которой составил 30,2%. Это заявление вызвало немедленный технический спор, поскольку та же модель набрала всего 7,8%, когда её прогнали через официальный тестовый стенд бенчмарка.

Почему результат ARC-AGI-3 имеет значение

ARC-AGI-3 проверяет способность модели решать совершенно новые, требующие глубоких рассуждений задачи, а не полагаться на заученные паттерны. Исследователи используют эти показатели как прокси-метрику прогресса в области «общего интеллекта» (general intelligence), поэтому отрыв в десять пунктов выглядит как существенный шаг к человекоподобному решению задач. Одно это объясняет, почему новость вызвала такой резонанс в ИИ-сообществе.

Скрытый рычаг: Retained Reasoning и Compaction

OpenAI не проводила оценку GPT-5.6 Sol с использованием официального тестового стенда. Вместо этого компания использовала собственный Responses API с двумя проприетарными опциями:

  • Retained Reasoning — поддерживает цепочку рассуждений (chain of thought) модели на протяжении нескольких шагов, предотвращая потерю промежуточной логики, которая возникает, когда каждый шаг рассматривается изолированно.
  • Compaction — сжимает предыдущий контекст вместо того, чтобы просто отсекать его, позволяя модели ссылаться на более длинную, обобщенную историю.

При активации этих настроек модель выстраивает более длинные аргументы и повторно использует предыдущие выводы, что искусственно завышает показатели в многошаговых задачах. В официальном стенде, который отбрасывает рассуждения после каждого действия, результат той же модели падает до 7,8%, что ставит её значительно ниже Claude Opus 5.

OpenAI утверждает, что бенчмарк должен измерять весь конвейер вывода (inference pipeline), а не только «сырые» веса нейросети. С этой точки зрения «обертка» — логика API, которая сохраняет и сжимает контекст, — является частью оцениваемой системы.

Дебаты о справедливости

Франсуа Шолле (François Chollet), сооснователь ARC Prize, спонсирующего бенчмарк, высказал своё мнение. Он провел различие между специализированными стендами, созданными для «взлома» бенчмарка, и настройками API общего назначения, которые может включить любой пользователь. Шолле отметил, что в оригинальной среде тестирования ARC Prize использовался старый API completions в стиле OpenAI, в котором отсутствовали продвинутые функции, доступные сейчас в API Claude от Anthropic. Это несоответствие могло поставить OpenAI в невыгодное положение в предыдущих раундах.

Он не стал объявлять сравнение недействительным. Шолле заявил, что прямое сравнение остается приемлемым, если раскрыты точные настройки и любые сопутствующие затраты. Прозрачность, по его мнению, позволит сообществу оценить, вызван ли разрыв архитектурой модели, инженерными хитростями или и тем, и другим сразу.

Кто выигрывает, а кто проигрывает

Если более высокий результат будет принят как факт, OpenAI получит бонус к общественному восприятию и более сильную позицию в переговорах о корпоративном лицензировании. Команда Claude сможет указать на производительность «сырой» модели на стандартизированном стенде как на доказательство того, что их архитектура более эффективна, когда она лишена дополнительных инженерных слоев.

Исследователи и разработчики, которые полагаются на рейтинги бенчмарков при принятии инвестиционных решений, могут счесть этот инцидент тревожным. Этот случай показывает, что по мере роста моделей программное обеспечение, управляющее их выводом (inference), может стать решающим фактором. Компании, поставляющие сложные стеки вывода с низкой предельной стоимостью, могут доминировать в заголовках новостей, не имея при этом превосходящей базовой модели.

Что дальше для ARC-AGI-3 и других бенчмарков

Спор, вероятно, подтолкнет организаторов ARC Prize к ужесточению правил относительно допустимых конфигураций вывода. Возможные меры включают:

  • Публикацию «базового» (baseline) результата, отражающего производительность только при использовании официального стенда.
  • Требование к участникам предоставлять анализ стоимости любых дополнительных настроек, чтобы высокий результат можно было сопоставить с дополнительными вычислительными или инженерными затратами.
  • Добавление отдельного трека «системного уровня», поощряющего грамотное использование функций управления контекстом.

Такие шаги обеспечат более четкое разделение между возможностями «сырой» модели и инженерной оптимизацией, что облегчит сравнение будущих результатов.

Контраргумент: бенчмарки должны отражать реальное использование

Одна из сторон утверждает, что строгий подход «только сырая модель» нереалистичен. В реальных условиях эксплуатации (production) разработчики постоянно накладывают кэширование, суммаризацию контекста и другие приемы на языковые модели. Если бенчмарк стремится предсказать практическую полезность, он должен позволять — или даже поощрять — такие оптимизации. С этой точки зрения Retained Reasoning и Compaction от OpenAI являются законными инструментами, которые может принять любой конкурент, при условии, что они публично задокументированы.

Критики возражают, что без единого базового уровня показатели становятся «движущейся мишенью», подрывая роль бенчмарка как объективного мерила. Противоречие между экологической валидностью (отражающей реальные условия эксплуатации) и методологической чистотой (изоляцией модели) подогревает текущую полемику.

Основной вывод

Заявление о GPT-5.6 Sol высвечивает растущий раскол в оценке ИИ: противостояние «чистого» таланта модели и инженерной экосистемы, которая его извлекает. Пока сообщество требует полного раскрытия настроек инференса и их стоимости, дискуссия будет лишь обостряться, а не затуманивать наше представление о прогрессе на пути к общему интеллекту.