GPT-5.6-SOL успешно справилась с тремя многоэтапными задачами по математике, физике и программированию, в то время как у Kimi K3 закончился бюджет токенов и произошло превышение времени ожидания на тех же самых промптах, что выявило практическое ограничение для разработчиков, которым нужны надежные, полные ответы.
Почему этот тест важен
Обе модели получили идентичные промпты с одинаковым лимитом токенов без использования инструментов поиска в интернете. Бенчмарк был сосредоточен на многоэтапном рассуждении — потребности, часто встречающейся при научных вычислениях и генерации кода. В условиях реальной эксплуатации модель, которая исчерпывает выделенный ей объем токенов до выдачи окончательного результата, может блокировать рабочие процессы и увеличивать объем работ по отладке.
Итоги прямого сравнения
GPT-5.6-SOL
- Предоставила полный ответ на каждую из трех задач.
- Выдала верные математические и физические выводы.
- Сгенерировала Python-скрипт, который скомпилировался и запустился на локальном интерпретаторе.
- Пропустила один тестовый случай в примере вывода, но основная логика осталась верной.
Kimi K3
- Не смогла выдать видимое решение задач по математике и физике.
- Неоднократно достигала лимита токенов, обрывая цепочку рассуждений до того, как мог появиться вывод.
- Прекратила работу через 245 секунд на задаче по программированию, не выдав исполняемого кода.
Ключевые выводы для специалистов
- Токены на рассуждение против финального вывода — Kimi K3 тратит значительную часть своего бюджета токенов на внутренние цепочки размышлений. При фиксированном бюджете модели часто не хватает места для выдачи самого ответа, что делает её непригодной для рабочих процессов, требующих мгновенного результата.
- Логика против тестирования — даже модель, которая правильно выстраивает рассуждения, может ошибиться в сопутствующих деталях. Ошибка в тестовом случае у GPT-5.6-SOL напоминает нам о необходимости вручную проверять сгенерированный проверочный код.
- Задержка и причины завершения имеют значение — в производственных конвейерах следует логировать не только финальный ответ, но и причину остановки модели (лимит токенов, таймаут и т. д.), а также количество токенов, затраченных на рассуждение.
На что обратить внимание в дальнейшем
Пока подобные изменения не произошли, разработчики, которым нужны надежные сквозные результаты, скорее всего, будут отдавать предпочтение таким моделям, как GPT-5.6-SOL, для задач, связанных с цепочками вычислений или синтезом кода.
Для команд, создающих автоматизированные системы, этот бенчмарк подчеркивает простое правило: проверяйте как правильность ответа, так и способность модели прийти к этому ответу в рамках установленных вами эксплуатационных ограничений. Модель, которая «думает», но никогда не заканчивает, — это не более чем тупик.
