המודל של VIDRAFT בעל 398 מיליארד הפרמטרים, Darwin-398B-JGOS, תפס את המקום השלישי בטבלת המובילים של GPQA Diamond תוך שימוש ב-24 GPUs בלבד. התוצאה מוכיחה שסטארט-אפ קוריאני קטן יכול להתחרות במעבדות ה-AI הגדולות בעולם במבחן הדורש חשיבה מדעית אמיתית במקום תשובות שנלמדו בעל פה.
למה GPQA Diamond חשוב
GPQA Diamond מציג שאלות מדעיות ברמת תארים מתקדמים שאינן מופיעות באתרים ציבוריים. מכיוון שלא ניתן לבצע להן scraping, המודל חייב להפעיל היגיון כדי לפתור את הבעיה במקום לשלוף עובדה שמורה. מדד זה מחייב לוגיקה, לא שינון.
טבלת המובילים הנוכחית
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin עוקף מודלים של Nvidia, DeepSeek ומספר פיתוחים אמריקאיים וסיניים, למרות שהוא פועל על שבריר מהחומרה המקובלת בפרויקטים כאלה.
השיטה שמאחורי הניצחון
VIDRAFT לא רכשה חוות GPU עצומה. במקום זאת, הצוות השתמש ב-"evolutionary merging", תוך שילוב איטרטיבי של מספר מודלים בקוד פתוח ושמירה על הרכיבים בעלי הביצועים הטובים ביותר. הרצת המודל על אשכול (cluster) צנוע של 24 GPUs הניבה רשת איכותית בעלת 398 מיליארד פרמטרים, ללא ההוצאה ההונית שבדרך כלל נדרשת לאימון מאפס.
מה זה אומר על תחום ה-AI
- חסם כניסה נמוך יותר: בניית AI עילית כבר אינה דורשת אלפי GPUs.
הסתייגויות ונקודות למחשבה
Darwin עדיין מפגר אחרי שני המובילים בפער קטן, והגודל שלו – 398 מיליארד פרמטרים – נותר עצום; אימון או הרצה (serving) של המודל עדיין דורשים תשתית משמעותית. הגישה נשענת על מיזוג אבולוציוני של מודלים פתוחים על אשכול קטן. GPQA Diamond שימש כמדד המבחן.
מה כדאי לעקוב אחריו בהמשך
המסקנה ברורה: אסטרטגיות חכמות של מיזוג מודלים (model-fusion) יכולות לקזז את הצורך בכוח מחשוב גולמי, ובכך לעצב מחדש את השאלה מי יכול להתחרות ברמות הגבוהות ביותר של מחקר AI.
