VIDRAFT యొక్క 398-బిలియన్-పారామీటర్ మోడల్, Darwin-398B-JGOS, కేవలం 24 GPUలను ఉపయోగించి GPQA Diamond లీడర్బోర్డ్లో మూడవ స్థానాన్ని కైవసం చేసుకుంది. కేవలం సమాచారాన్ని గుర్తుంచుకోవడం కాకుండా, నిజమైన శాస్త్రీయ తర్కాన్ని (scientific reasoning) కోరే పరీక్షలో, ఒక చిన్న కొరియన్ స్టార్టప్ ప్రపంచంలోని అతిపెద్ద AI ల్యాబ్లకు పోటీగా నిలవగలదని ఈ ఫలితం నిరూపిస్తోంది.
GPQA Diamond ఎందుకు ముఖ్యమైనది
GPQA Diamond పబ్లిక్ వెబ్సైట్లలో కనిపించని గ్రాడ్యుయేట్ స్థాయి సైన్స్ ప్రశ్నలను అడుగుతుంది. సమాధానాలను స్క్రాపింగ్ (scraping) ద్వారా పొందలేము కాబట్టి, ఒక మోడల్ నిల్వ చేయబడిన వాస్తవాలను వెతకడం కంటే, సమస్యను తర్కంతో పరిష్కరించాల్సి ఉంటుంది. ఈ బెంచ్మార్క్ జ్ఞాపకశక్తిని కాకుండా, తర్కాన్ని (logic) పరీక్షించేలా చేస్తుంది.
ప్రస్తుత లీడర్బోర్డ్
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
ఇటువంటి ప్రాజెక్టులకు సాధారణంగా అవసరమయ్యే హార్డ్వేర్తో పోలిస్తే, Darwin చాలా తక్కువ హార్డ్వేర్పై నడుస్తున్నప్పటికీ, Nvidia, DeepSeek మరియు అనేక అమెరికన్, చైనీస్ మోడల్లను అధిగమించింది.
ఈ విజయానికి గల పద్ధతి
VIDRAFT భారీ GPU ఫామ్ను కొనుగోలు చేయలేదు. దానికి బదులుగా, బృందం “evolutionary merging” పద్ధతిని ఉపయోగించింది. ఇందులో బహుళ ఓపెన్-సోర్స్ మోడల్లను పునరావృత పద్ధతిలో (iteratively) కలిపి, అత్యుత్తమ పనితీరు కనబరిచే భాగాలను మాత్రమే ఉంచుకున్నారు. కేవలం 24-GPU క్లస్టర్పై దీనిని నడపడం ద్వారా, మొదటి నుండి శిక్షణ ఇవ్వడానికి సాధారణంగా అవసరమయ్యే భారీ పెట్టుబడి లేకుండానే, అధిక నాణ్యత కలిగిన 398-బిలియన్-పారామీటర్ నెట్వర్క్ను రూపొందించారు.
AI రంగంపై దీని ప్రభావం
- ప్రవేశ అడ్డంకులు తగ్గడం: ఎలైట్ AIని నిర్మించడానికి ఇకపై వేల సంఖ్యలో GPUలు అవసరం లేదు.
పరిమితులు మరియు ఇతర అంశాలు
Darwin ఇంకా మొదటి రెండు స్థానాల్లో ఉన్న మోడల్ల కంటే స్వల్ప తేడాతో వెనుకబడి ఉంది, మరియు దాని 398-బిలియన్-పారామీటర్ పరిమాణం ఇప్పటికీ చాలా పెద్దది—ఈ మోడల్కు శిక్షణ ఇవ్వడానికి లేదా దానిని ఉపయోగించడానికి (serving) ఇప్పటికీ గణనీయమైన మౌలిక సదుపాయాలు అవసరం. ఈ విధానం చిన్న క్లస్టర్పై ఓపెన్ మోడల్ల "evolutionary merging" పై ఆధారపడి ఉంటుంది. GPQA Diamond ఇక్కడ బెంచ్మార్క్గా పనిచేసింది.
తదుపరి ఏం చూడాలి
దీని సారాంశం స్పష్టంగా ఉంది: తెలివైన మోడల్-ఫ్యూజన్ (model-fusion) వ్యూహాలు కంప్యూటింగ్ శక్తి (raw compute) లోటును భర్తీ చేయగలవు, తద్వారా AI పరిశోధనలో అత్యున్నత స్థాయిలలో ఎవరు పోటీ పడగలరు అనే అంశాన్ని ఇది మారుస్తుంది.
