Model VIDRAFT o 398 miliardach parametrów, Darwin-398B-JGOS, zajął trzecie miejsce w rankingu GPQA Diamond, wykorzystując zaledwie 24 procesory GPU. Wynik ten dowodzi, że mały koreański startup może rywalizować z największymi laboratoriami AI na świecie w teście wymagającym prawdziwego rozumowania naukowego, a nie wyuczonych na pamięć odpowiedzi.
Dlaczego GPQA Diamond ma znaczenie
GPQA Diamond zawiera pytania naukowe na poziomie studiów magisterskich, które nie pojawiają się w publicznych serwisach internetowych. Ponieważ odpowiedzi nie można pobrać metodą scrapingu, model musi logicznie rozwiązać problem, zamiast jedynie przywoływać zapamiętany fakt. Benchmark ten wymusza logikę, a nie zapamiętywanie.
Obecny ranking
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin wyprzedza modele firm Nvidia, DeepSeek oraz kilka rozwiązań z USA i Chin, mimo że działa na ułamku sprzętu typowego dla tego rodzaju projektów.
Metoda stojąca za zwycięstwem
VIDRAFT nie kupił ogromnej farmy GPU. Zamiast tego zespół zastosował „evolutionary merging”, iteracyjnie łącząc wiele modeli open-source i zachowując najlepiej działające komponenty. Uruchomienie tego na skromnym klastrze 24 jednostek GPU pozwoliło uzyskać wysokiej jakości sieć o 398 miliardach parametrów, bez nakładów kapitałowych zazwyczaj niezbędnych do trenowania modelu od zera.
Co to oznacza dla dziedziny AI
- Obniżenie bariery wejścia: Budowa elitarnych systemów AI nie wymaga już tysięcy procesorów GPU.
Zastrzeżenia i kontrargumenty
Darwin wciąż odstaje od dwóch liderów niewielką różnicą, a jego rozmiar wynoszący 398 miliardów parametrów pozostaje ogromny – trenowanie lub serwowanie modelu wciąż wymaga znaczącej infrastruktury. Podejście to opiera się na „evolutionary merging” otwartych modeli na małym klastrze. GPQA Diamond posłużyło jako benchmark.
Na co warto zwrócić uwagę w przyszłości
Wniosek jest jasny: sprytne strategie fuzji modeli mogą zrekompensować brak surowej mocy obliczeniowej, zmieniając to, kto może rywalizować na najwyższym poziomie badań nad AI.
