Модель Darwin-398B-JGOS с 398 миллиардами параметров от VIDRAFT заняла третье место в лидерборде GPQA Diamond, используя всего 24 GPU. Этот результат доказывает, что небольшой корейский стартап может соперничать с крупнейшими мировыми ИИ-лабораториями в тесте, требующем подлинного научного мышления, а не простого воспроизведения заученных ответов.

Почему GPQA Diamond имеет значение

GPQA Diamond содержит вопросы по науке уровня магистратуры, которые не встречаются на публичных веб-сайтах. Поскольку ответы невозможно собрать методом веб-скрейпинга, модель должна рассуждать над задачей, а не просто извлекать сохраненный факт. Этот бенчмарк требует логики, а не заучивания.

Текущий лидерборд

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwin опережает модели от Nvidia, DeepSeek и ряд американских и китайских разработок, хотя работает на гораздо меньшем количестве оборудования, чем обычно требуется для подобных проектов.

Метод, стоящий за победой

VIDRAFT не стала покупать огромную ферму GPU. Вместо этого команда использовала «эволюционное слияние» (evolutionary merging), итеративно комбинируя несколько моделей с открытым исходным кодом и сохраняя наиболее эффективные компоненты. Запуск этого процесса на скромном кластере из 24 GPU позволил получить высококачественную сеть с 398 миллиардами параметров без капитальных затрат, которые обычно требуются для обучения с нуля.

Что это значит для сферы ИИ

  • Снижение порога входа: Создание элитного ИИ больше не требует тысяч GPU.

Оговорки и контраргументы

Darwin все еще немного отстает от двух лидеров, а его размер в 398 миллиардов параметров остается огромным — обучение или развертывание модели по-прежнему требуют значительной инфраструктуры. Подход основывается на эволюционном слиянии открытых моделей на небольшом кластере. В качестве эталона использовался GPQA Diamond.

За чем следить дальше

Вывод очевиден: умные стратегии слияния моделей могут компенсировать нехватку вычислительных мощностей, меняя правила игры и определяя, кто сможет конкурировать на самых высоких уровнях исследований в области ИИ.