Het 398 miljard parameters tellende model van VIDRAFT, Darwin-398B-JGOS, behaalde de derde plaats op de GPQA Diamond-leaderboard met slechts 24 GPU's. Het resultaat bewijst dat een kleine Koreaanse startup kan concurreren met de grootste AI-labs ter wereld op een test die echte wetenschappelijke redenering vereist in plaats van uit het hoofd geleerde antwoorden.

Waarom GPQA Diamond belangrijk is

GPQA Diamond stelt wetenschappelijke vragen op promovendusniveau die niet op openbare websites voorkomen. Omdat de antwoorden niet gescraped kunnen worden, moet een model door het probleem heen redeneren in plaats van een opgeslagen feit op te halen. De benchmark dwingt logica af, geen memorisatie.

De huidige leaderboard

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwin presteert beter dan modellen van Nvidia, DeepSeek en verschillende Amerikaanse en Chinese aanbiedingen, ook al draait het op een fractie van de hardware die gebruikelijk is voor dergelijke projecten.

De methode achter de overwinning

VIDRAFT heeft geen enorme GPU-boerderij gekocht. In plaats daarvan gebruikte het team “evolutionary merging”, waarbij iteratief meerdere open-source modellen werden gecombineerd en de best presterende componenten werden behouden. Het draaien hiervan op een bescheiden cluster van 24 GPU's leverde een hoogwaardig netwerk van 398 miljard parameters op, zonder de kapitaalinvestering die normaal gesproken nodig is om vanaf nul te trainen.

Wat dit betekent voor het AI-veld

  • Verlaagde toetredingsdrempel: Het bouwen van elite AI vereist niet langer duizenden GPU's.

Kanttekeningen en tegenargumenten

Darwin loopt nog steeds een kleine marge achter op de twee koplopers, en de omvang van 398 miljard parameters blijft enorm — het trainen of serveren van het model vereist nog steeds aanzienlijke infrastructuur. De aanpak is gebaseerd op "evolutionary merging" van open modellen op een klein cluster. GPQA Diamond diende als de benchmark.

Waar we de komende tijd op moeten letten

De conclusie is duidelijk: slimme strategieën voor model-fusie kunnen ruwe rekenkracht compenseren, waardoor de verhoudingen verschuiven over wie kan concurreren op de hoogste niveaus van AI-onderzoek.