VIDRAFT ਦੇ 398-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ, Darwin-398B-JGOS ਨੇ ਸਿਰਫ਼ 24 GPUs ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ GPQA Diamond ਲੀਡਰਬੋਰਡ 'ਤੇ ਤੀਜਾ ਸਥਾਨ ਹਾਸਲ ਕੀਤਾ। ਇਹ ਨਤੀਜਾ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਇੱਕ ਛੋਟੀ ਕੋਰੀਅਨ ਸਟਾਰਟਅੱਪ ਉਸ ਟੈਸਟ 'ਤੇ ਦੁਨੀਆ ਦੀਆਂ ਸਭ ਤੋਂ ਵੱਡੀਆਂ AI ਲੈਬਾਂ ਨੂੰ ਟੱਕਰ ਦੇ ਸਕਦਾ ਹੈ ਜੋ ਰਟੇ ਹੋਏ ਜਵਾਬਾਂ ਦੀ ਬਜਾਏ ਅਸਲ ਵਿਗਿਆਨਕ ਤਰਕ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ।

GPQA Diamond ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

GPQA Diamond ਗ੍ਰੈਜੂਏਟ-ਪੱਧਰ ਦੇ ਵਿਗਿਆਨਕ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ ਜੋ ਜਨਤਕ ਵੈੱਬਸਾਈਟਾਂ 'ਤੇ ਨਹੀਂ ਮਿਲਦੇ। ਕਿਉਂਕਿ ਇਹਨਾਂ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਸਕ੍ਰੈਪ (scrape) ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ, ਇਸ ਲਈ ਇੱਕ ਮਾਡਲ ਨੂੰ ਸਿਰਫ਼ ਸਟੋਰ ਕੀਤੇ ਹੋਏ ਤੱਥਾਂ ਨੂੰ ਲੱਭਣ ਦੀ ਬਜਾਏ ਸਮੱਸਿਆ ਰਾਹੀਂ ਤਰਕ ਕਰਨਾ ਪੈਂਦਾ ਹੈ। ਇਹ ਬੈਂਚਮਾਰਕ ਯਾਦ ਰੱਖਣ ਦੀ ਬਜਾਏ ਤਰਕ (logic) ਦੀ ਵਰਤੋਂ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।

ਮੌਜੂਦਾ ਲੀਡਰਬੋਰਡ

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwin, Nvidia, DeepSeek ਅਤੇ ਕਈ ਅਮਰੀਕੀ ਅਤੇ ਚੀਨੀ ਮਾਡਲਾਂ ਤੋਂ ਅੱਗੇ ਨਿਕਲ ਗਿਆ ਹੈ, ਭਾਵੇਂ ਕਿ ਇਹ ਅਜਿਹੇ ਪ੍ਰੋਜੈਕਟਾਂ ਲਈ ਆਮ ਤੌਰ 'ਤੇ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਹਾਰਡਵੇਅਰ ਦੇ ਇੱਕ ਛੋਟੇ ਹਿੱਸੇ 'ਤੇ ਹੀ ਚੱਲਦਾ ਹੈ।

ਜਿੱਤ ਦੇ ਪਿੱਛੇ ਦੀ ਵਿਧੀ

VIDRAFT ਨੇ ਕੋਈ ਵਿਸ਼ਾਲ GPU ਫਾਰਮ ਨਹੀਂ ਖਰੀਦਿਆ। ਇਸ ਦੀ ਬਜਾਏ, ਟੀਮ ਨੇ “evolutionary merging” ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਜਿਸ ਵਿੱਚ ਕਈ ਓਪਨ-ਸੋਰਸ ਮਾਡਲਾਂ ਨੂੰ ਵਾਰ-ਵਾਰ ਜੋੜਿਆ ਗਿਆ ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਕਰਨ ਵਾਲੇ ਹਿੱਸਿਆਂ ਨੂੰ ਰੱਖਿਆ ਗਿਆ। ਇੱਕ ਮਾਮੂਲੀ 24-GPU ਕਲੱਸਟਰ 'ਤੇ ਇਸ ਨੂੰ ਚਲਾਉਣ ਨਾਲ ਇੱਕ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲਾ, 398-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਨੈੱਟਵਰਕ ਮਿਲਿਆ, ਜਿਸ ਲਈ ਸ਼ੁਰੂ ਤੋਂ ਸਿਖਲਾਈ (train) ਦੇਣ ਲਈ ਆਮ ਤੌਰ 'ਤੇ ਲੋੜੀਂਦੇ ਵੱਡੇ ਪੂੰਜੀ ਖਰਚੇ ਦੀ ਲੋੜ ਨਹੀਂ ਪਈ।

AI ਖੇਤਰ ਲਈ ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

  • ਪ੍ਰਵੇਸ਼ ਦੀ ਰੁਕਾਵਟ ਘੱਟ ਗਈ: ਹੁਣ ਉੱਤਮ AI ਬਣਾਉਣ ਲਈ ਹਜ਼ਾਰਾਂ GPUs ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ।

ਸਾਵਧਾਨੀਆਂ ਅਤੇ ਵਿਰੋਧੀ ਨੁਕਤੇ

Darwin ਅਜੇ ਵੀ ਦੋ ਲੀਡਰਾਂ ਤੋਂ ਬਹੁਤ ਘੱਟ ਫਰਕ ਨਾਲ ਪਿੱਛੇ ਹੈ, ਅਤੇ ਇਸਦਾ 398-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਦਾ ਆਕਾਰ ਅਜੇ ਵੀ ਬਹੁਤ ਵੱਡਾ ਹੈ—ਮਾਡਲ ਨੂੰ ਟ੍ਰੇਨ ਕਰਨ ਜਾਂ ਚਲਾਉਣ ਲਈ ਅਜੇ ਵੀ ਮਹੱਤਵਪੂਰਨ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੀ ਲੋੜ ਹੈ। ਇਹ ਪਹੁੰਚ ਇੱਕ ਛੋਟੇ ਕਲੱਸਟਰ 'ਤੇ ਓਪਨ ਮਾਡਲਾਂ ਦੇ “evolutionary merging” 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ। GPQA Diamond ਨੇ ਬੈਂਚਮਾਰਕ ਵਜੋਂ ਕੰਮ ਕੀਤਾ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

ਸਿੱਟਾ ਸਪੱਸ਼ਟ ਹੈ: ਚਲਾਕ ਮਾਡਲ-ਫਿਊਜ਼ਨ (model-fusion) ਰਣਨੀਤੀਆਂ ਕੰਪਿਊਟਿੰਗ ਪਾਵਰ ਦੀ ਕਮੀ ਨੂੰ ਪੂਰਾ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਜਿਸ ਨਾਲ ਇਹ ਬਦਲ ਜਾਵੇਗਾ ਕਿ AI ਖੋਜ ਦੇ ਸਭ ਤੋਂ ਉੱਚੇ ਪੱਧਰਾਂ 'ਤੇ ਕੌਣ ਮੁਕਾਬਲਾ ਕਰ ਸਕਦਾ ਹੈ।