O modelo de 398 bilhões de parâmetros da VIDRAFT, Darwin-398B-JGOS, conquistou o terceiro lugar no leaderboard do GPQA Diamond usando apenas 24 GPUs. O resultado prova que uma pequena startup coreana pode rivalizar com os maiores laboratórios de IA do mundo em um teste que exige raciocínio científico genuíno em vez de respostas memorizadas.
Por que o GPQA Diamond é importante
O GPQA Diamond faz perguntas de ciência de nível de pós-graduação que não aparecem em sites públicos. Como as respostas não podem ser extraídas via scraping, o modelo deve raciocinar sobre o problema em vez de apenas recuperar um fato armazenado. O benchmark força a lógica, não a memorização.
O leaderboard atual
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
O Darwin supera modelos da Nvidia, DeepSeek e diversas ofertas dos EUA e da China, embora rode em uma fração do hardware típico para projetos desse tipo.
O método por trás da vitória
A VIDRAFT não comprou uma fazenda massiva de GPUs. Em vez disso, a equipe utilizou o “evolutionary merging” (fusão evolutiva), combinando iterativamente múltiplos modelos de código aberto e mantendo os componentes de melhor desempenho. Executar isso em um cluster modesto de 24 GPUs resultou em uma rede de alta qualidade com 398 bilhões de parâmetros, sem o gasto de capital normalmente necessário para treinar do zero.
O que isso significa para o campo da IA
- Barreira de entrada reduzida: Construir uma IA de elite não exige mais milhares de GPUs.
Ressalvas e contrapontos
O Darwin ainda fica atrás dos dois líderes por uma margem estreita, e seu tamanho de 398 bilhões de parâmetros continua sendo massivo — treinar ou servir o modelo ainda exige uma infraestrutura significativa. A abordagem baseia-se na fusão evolutiva de modelos abertos em um pequeno cluster. O GPQA Diamond serviu como o benchmark.
O que observar a seguir
A conclusão é clara: estratégias inteligentes de fusão de modelos podem compensar o poder de computação bruto, remodelando quem pode competir nos níveis mais altos da pesquisa em IA.
