VIDRAFTs 398-Milliarden-Parameter-Modell, Darwin-398B-JGOS, belegte mit nur 24 GPUs den dritten Platz auf dem GPQA Diamond Leaderboard. Das Ergebnis beweist, dass ein kleines koreanisches Startup mit einem Test mithalten kann, der echtes wissenschaftliches Denken statt auswendig gelernter Antworten erfordert, und damit mit den weltweit größten KI-Laboren konkurriert.
Warum GPQA Diamond wichtig ist
GPQA Diamond stellt naturwissenschaftliche Fragen auf Graduate-Niveau, die nicht auf öffentlichen Websites zu finden sind. Da die Antworten nicht per Web-Scraping extrahiert werden können, muss ein Modell das Problem logisch durchdringen, anstatt lediglich eine gespeicherte Information abzurufen. Der Benchmark erzwingt Logik statt Auswendiglernen.
Das aktuelle Leaderboard
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin übertrifft Modelle von Nvidia, DeepSeek sowie mehrere US-amerikanische und chinesische Angebote, obwohl es mit einem Bruchteil der Hardware läuft, die für solche Projekte üblich ist.
Die Methode hinter dem Sieg
VIDRAFT hat keine massive GPU-Farm gekauft. Stattdessen nutzte das Team „evolutionary merging“, indem es iterativ mehrere Open-Source-Modelle kombinierte und die leistungsstärksten Komponenten beibehielt. Die Ausführung auf einem bescheidenen 24-GPU-Cluster lieferte ein hochwertiges Netzwerk mit 398 Milliarden Parametern, ohne die Kapitalaufwendungen, die normalerweise für ein Training von Grund auf erforderlich wären.
Was dies für das KI-Feld bedeutet
- Gesenkte Eintrittsbarrieren: Der Aufbau von Elite-KI erfordert nicht mehr Tausende von GPUs.
Einschränkungen und Gegenargumente
Darwin liegt immer noch knapp hinter den beiden Führenden, und seine Größe von 398 Milliarden Parametern bleibt massiv – das Training oder das Serving des Modells erfordert nach wie vor eine erhebliche Infrastruktur. Der Ansatz basiert auf dem „evolutionary merging“ von Open-Source-Modellen auf einem kleinen Cluster. GPQA Diamond diente dabei als Benchmark.
Worauf man als Nächstes achten sollte
Das Fazit ist klar: Clevere Modellfusions-Strategien können rohe Rechenleistung kompensieren und damit verändern, wer auf den höchsten Ebenen der KI-Forschung konkurrenzfähig sein kann.
