Модель VIDRAFT із 398 мільярдами параметрів, Darwin-398B-JGOS, посіла третє місце в таблиці лідерів GPQA Diamond, використовуючи лише 24 GPU. Цей результат доводить, що невеликий корейський стартап може конкурувати з найбільшими світовими ШІ-лабораторіями в тесті, який вимагає справжнього наукового мислення, а не просто запам'ятованих відповідей.

Чому GPQA Diamond має значення

GPQA Diamond містить наукові запитання рівня магістратури, які не зустрічаються на публічних вебсайтах. Оскільки відповіді неможливо зібрати шляхом веб-скрапінгу, модель повинна логічно міркувати над проблемою, а не просто відтворювати збережений факт. Цей бенчмарк вимагає логіки, а не механічного запам'ятовування.

Поточна таблиця лідерів

  • Kimi-K3 (Китай): 93.5
  • GLM-5.2 (Китай): 91.2
  • Darwin-398B-JGOS (Південна Корея): 90.9
  • DeepSeek-V4-Pro (Китай): 90.1
  • Inkling-Small (США): 89.5
  • Qwen3.5-397B-A17B (Китай): 88.4
  • Nemotron-3-Ultra-550B (США): 87.9

Darwin випереджає моделі від Nvidia, DeepSeek та кілька американських і китайських розробок, хоча працює на значно меншій кількості обладнання, ніж зазвичай використовується в таких проєктах.

Метод, що стоїть за перемогою

VIDRAFT не купувала величезну ферму GPU. Замість цього команда використала «еволюційне злиття» (evolutionary merging), ітеративно поєднуючи кілька моделей із відкритим кодом і залишаючи найбільш продуктивні компоненти. Запуск цього процесу на скромному кластері з 24 GPU дозволив створити високоякісну мережу з 398 мільярдами параметрів без величезних капіталовкладень, які зазвичай потрібні для навчання з нуля.

Що це означає для галузі ШІ

  • Зниження порогу входу: Створення елітного ШІ більше не потребує тисяч GPU.

Застереження та контраргументи

Darwin все ще трохи відстає від двох лідерів, а його розмір у 398 мільярдів параметрів залишається величезним — навчання або обслуговування моделі все одно потребує значної інфраструктури. Підхід базується на еволюційному злитті відкритих моделей на малому кластері. Бенчмарком виступив GPQA Diamond.

На що звернути увагу далі

Висновок очевидний: розумні стратегії злиття моделей можуть компенсувати брак обчислювальних потужностей, змінюючи правила гри щодо того, хто може конкурувати на найвищих рівнях досліджень у сфері ШІ.