Модель VIDRAFT із 398 мільярдами параметрів, Darwin-398B-JGOS, посіла третє місце в таблиці лідерів GPQA Diamond, використовуючи лише 24 GPU. Цей результат доводить, що невеликий корейський стартап може конкурувати з найбільшими світовими ШІ-лабораторіями в тесті, який вимагає справжнього наукового мислення, а не просто запам'ятованих відповідей.
Чому GPQA Diamond має значення
GPQA Diamond містить наукові запитання рівня магістратури, які не зустрічаються на публічних вебсайтах. Оскільки відповіді неможливо зібрати шляхом веб-скрапінгу, модель повинна логічно міркувати над проблемою, а не просто відтворювати збережений факт. Цей бенчмарк вимагає логіки, а не механічного запам'ятовування.
Поточна таблиця лідерів
- Kimi-K3 (Китай): 93.5
- GLM-5.2 (Китай): 91.2
- Darwin-398B-JGOS (Південна Корея): 90.9
- DeepSeek-V4-Pro (Китай): 90.1
- Inkling-Small (США): 89.5
- Qwen3.5-397B-A17B (Китай): 88.4
- Nemotron-3-Ultra-550B (США): 87.9
Darwin випереджає моделі від Nvidia, DeepSeek та кілька американських і китайських розробок, хоча працює на значно меншій кількості обладнання, ніж зазвичай використовується в таких проєктах.
Метод, що стоїть за перемогою
VIDRAFT не купувала величезну ферму GPU. Замість цього команда використала «еволюційне злиття» (evolutionary merging), ітеративно поєднуючи кілька моделей із відкритим кодом і залишаючи найбільш продуктивні компоненти. Запуск цього процесу на скромному кластері з 24 GPU дозволив створити високоякісну мережу з 398 мільярдами параметрів без величезних капіталовкладень, які зазвичай потрібні для навчання з нуля.
Що це означає для галузі ШІ
- Зниження порогу входу: Створення елітного ШІ більше не потребує тисяч GPU.
Застереження та контраргументи
Darwin все ще трохи відстає від двох лідерів, а його розмір у 398 мільярдів параметрів залишається величезним — навчання або обслуговування моделі все одно потребує значної інфраструктури. Підхід базується на еволюційному злитті відкритих моделей на малому кластері. Бенчмарком виступив GPQA Diamond.
На що звернути увагу далі
Висновок очевидний: розумні стратегії злиття моделей можуть компенсувати брак обчислювальних потужностей, змінюючи правила гри щодо того, хто може конкурувати на найвищих рівнях досліджень у сфері ШІ.
