GPT-5.6-SOL виконала три багатоетапні завдання з математики, фізики та програмування, тоді як Kimi K3 вичерпала бюджет токенів і завершилася за тайм-аутом на тих самих запитах, що виявило практичне обмеження для розробників, яким потрібні надійні відповіді від початку до кінця.

Чому цей тест має значення

Обидві моделі отримали ідентичні запити з однаковим лімітом токенів без увімкнених інструментів пошуку в інтернеті. Тест зосередився на багатоетапному міркуванні — потребі, що є поширеною в наукових розрахунках та генерації коду. У реальних умовах модель, яка вичерпує свій ліміт токенів до надання остаточного результату, може зупинити робочі процеси (pipelines) і збільшити обсяг роботи з налагодження.

Що сталося під час прямого протистояння

GPT-5.6-SOL

  • Надала повну відповідь на кожен із трьох викликів.
  • Надала правильні математичні та фізичні виведення.
  • Згенерувала Python-скрипт, який скомпілювався та запустився на локальному інтерпретаторі.
  • Пропустила один тест-кейс у прикладі виводу, але основна логіка залишилася правильною.

Kimi K3

  • Не змогла надати видиме рішення для задач із математики та фізики.
  • Багаторазово досягала ліміту токенів, перериваючи міркування до того, як міг з'явитися висновок.
  • Зупинилася через 245 секунд під час виконання завдання з програмування, не надавши коду, готового до запуску.

Ключові висновки для практиків

  • Токени на міркування проти фінального результату – Kimi K3 витрачає значну частину свого бюджету токенів на внутрішні ланцюжки думок. Коли бюджет обмежений, моделі часто не вистачає місця, щоб видати відповідь, що робить її непридатною для робочих процесів, які потребують негайного результату.
  • Логіка проти тестування – Навіть модель, яка правильно будує міркування, може помилитися в другорядних деталях. Неправильний тест-кейс у GPT-5.6-SOL нагадує нам про необхідність вручну перевіряти згенерований код валідації.
  • Затримка та причини завершення мають значення – У виробничих конвеєрах (production pipelines) слід логувати не лише фінальну відповідь, а й причину зупинки моделі (ліміт токенів, тайм-аут тощо) та кількість токенів, витрачених на міркування.

На що звернути увагу далі

Доки такі зміни не з'являться, розробники, яким потрібні надійні результати від початку до кінця, ймовірно, надаватимуть перевагу таким моделям, як GPT-5.6-SOL, для завдань, що передбачають ланцюжки обчислень або синтез коду.

Для команд, які розробляють автоматизовані системи, цей бенчмарк підкреслює просте правило: тестуйте як правильність відповіді, так і здатність моделі дійти цієї відповіді в межах встановлених вами операційних обмежень. Модель, яка «думає», але ніколи не завершує роботу, — це не що інше, як глухий кут.