Kimi K3 вичерпала свої сили, тоді як GPT-5.6-SOL перетнула фінішну пряму на трьох складних запитах — задачі з теорії ймовірностей, сценарії з інерцією блоку та заплутаному Python-скрипту для задачі про рюкзак. Ця різниця демонструє, чому бюджетування токенів та затримка (latency) мають значення, коли вам потрібна модель, здатна логічно обробляти багатоетапні математичні, фізичні та програмні завдання без зупинок.
Чому цей бенчмарк важливий
Розробники та дослідники часто обирають LLM на основі гучних показників, а не на тому, як вона поводиться в реальних умовах. У цьому порівняльному тесті кожна модель вирішувала проблему, що вимагала довгого ланцюжка міркувань. GPT-5.6-SOL надала повні та правильні відповіді в усіх трьох сферах; Kimi K3 вичерпала свій бюджет токенів або завершилася за таймаутом, не видавши жодного корисного результату.
Налаштування тесту
- Математика — питання з теорії ймовірностей, яке вимагало обчислення ймовірності перекриття шаблонів, а також математичного сподівання та дисперсії (других моментів).
- Фізика — моделювання інерції блоку та втрати енергії, коли натягнутий пружиною кабель послаблюється.
- Програмування — написання рішення на Python для задачі про пакування рюкзака зі складними залежностями та правилами tie-break, а потім перевірка результату за шістьма незалежними тестовими випадками.
Що кажуть цифри
GPT-5.6-SOL
- Математика — надала повне, правильне рішення з чітко викладеними математичним сподіванням та дисперсією.
- Фізика — правильно побудувала модель інерції та врахувала втрату енергії, що відповідає аналітичній відповіді.
- Програмування — згенерувала код, який скомпілювався, запустився та пройшов усі шість зовнішніх перевірок. Внутрішній тест (assertion) був помилковим, що нагадує нам: тести, згенеровані моделлю, не є безпомилковими.
Kimi K3
- Математика — досягла ліміту токенів (спочатку на 6 500 токенах, потім на 10 000) і зупинилася, не показавши жодної відповіді.
- Фізика — закінчилися токени ще до появи будь-якого видимого результату.
- Програмування — завершилася за таймаутом через 245 секунд, не надавши нічого для оцінки.
Ефективність міркувань проти грубої сили
Висновок очевидний для кожного, хто будує продакшн-пайплайни: модель, яка витрачає токени, не видаючи результату, може зупинити подальші процеси, збільшити витрати та розчарувати користувачів.
Надійність та прихована вартість «ідеального» коду
Навіть модель-переможець припустилася помилки: самостійно згенерований тестовий випадок GPT-5.6-SOL містив хибний assertion. Це показує, що валідація, створена моделлю, не є заміною людській перевірці. Коли модель пише код, вам все одно потрібно проводити незалежні перевірки.
На що звернути увагу далі
- Відстеження причини завершення (finish reason) — ведіть лог того, чи закінчилася відповідь через досягнення ліміту токенів, таймаут чи природне завершення.
- Кількість токенів на міркування — порівняйте, скільки токенів кожна модель витрачає на внутрішні роздуми порівняно з фінальним результатом.
- Моніторинг затримки (latency) — вимірюйте реальний час виконання кожного кроку; модель, якій потрібні хвилини на один запит, може бути непридатною для інтерактивних додатків.
Розробникам слід сприймати ці метрики як першочергові сигнали, а не лише як фінальну відповідь.
Підсумок
GPT-5.6-SOL перевершує Kimi K3 за повнотою результатів. Тест також нагадує нам, що навіть модель, яка «робить усе правильно», все ще може створювати помилкові внутрішні перевірки, тому людський контроль залишається необхідним. Відстеження причин завершення, використання токенів та затримки допоможе вам обрати правильний інструмент для завдання, не потрапивши у пастку «тихого» таймауту.
