مدل ۳۹۸ میلیارد پارامتری VIDRAFT با نام Darwin-398B-JGOS، تنها با استفاده از ۲۴ پردازنده گرافیکی (GPU)، جایگاه سوم را در جدول رده‌بندی GPQA Diamond از آن خود کرد. این نتیجه ثابت می‌کند که یک استارتاپ کوچک کره‌ای می‌تواند در آزمونی که به جای پاسخ‌های حفظ‌شده، نیازمند استدلال علمی واقعی است، با بزرگترین آزمایشگاه‌های هوش مصنوعی جهان رقابت کند.

چرا GPQA Diamond اهمیت دارد

GPQA Diamond سوالات علمی در سطح تحصیلات تکمیلی را مطرح می‌کند که در وب‌سایت‌های عمومی یافت نمی‌شوند. از آنجایی که پاسخ‌ها را نمی‌توان استخراج (scrape) کرد، مدل باید به جای بازیابی یک واقعیت ذخیره‌شده، از طریق مسئله استدلال کند. این معیار، منطق را به چالش می‌کشد، نه حفظ کردن را.

جدول رده‌بندی فعلی

  • Kimi-K3 (چین): 93.5
  • GLM-5.2 (چین): 91.2
  • Darwin-398B-JGOS (کره): 90.9
  • DeepSeek-V4-Pro (چین): 90.1
  • Inkling-Small (آمریکا): 89.5
  • Qwen3.5-397B-A17B (چین): 88.4
  • Nemotron-3-Ultra-550B (آمریکا): 87.9

Darwin از مدل‌های Nvidia، DeepSeek و چندین محصول آمریکایی و چینی پیشی گرفته است، با وجود اینکه تنها با بخشی از سخت‌افزاری که معمولاً برای چنین پروژه‌هایی استفاده می‌شود، اجرا می‌شود.

روش پشت این پیروزی

VIDRAFT یک مزرعه عظیم GPU خریداری نکرد. در عوض، تیم از «ادغام تکاملی» (evolutionary merging) استفاده کرد که در آن چندین مدل متن‌باز را به صورت تکرارشونده با هم ترکیب کرده و بهترین اجزای با عملکرد بالا را نگه داشتند. اجرای این روش روی یک کلاستر متوسط ۲۴ واحدی GPU، منجر به ایجاد یک شبکه با کیفیت بالا و ۳۹۸ میلیارد پارامتر شد، بدون اینکه نیاز به هزینه‌های سرمایه‌ای عظیمی که معمولاً برای آموزش از صفر لازم است، باشد.

این موضوع چه معنایی برای حوزه هوش مصنوعی دارد

  • کاهش سد ورود: ساخت هوش مصنوعی سطح بالا دیگر نیازمند هزاران GPU نیست.

ملاحظات و نکات متقابل

Darwin همچنان با اختلاف اندکی از دو پیشتاز عقب‌تر است و اندازه ۳۹۸ میلیارد پارامتری آن همچنان بسیار بزرگ است؛ آموزش یا استقرار (serving) این مدل همچنان نیازمند زیرساخت‌های قابل توجهی است. این رویکرد بر ادغام تکاملی مدل‌های متن‌باز در یک کلاستر کوچک متکی است. GPQA Diamond نیز به عنوان معیار سنجش عمل کرد.

آنچه باید در آینده زیر نظر داشت

نتیجه‌گیری روشن است: استراتژی‌های هوشمندانه در ادغام مدل‌ها می‌تواند کمبود توان محاسباتی خام را جبران کرده و تعیین کند چه کسانی می‌توانند در بالاترین سطوح تحقیقات هوش مصنوعی رقابت کنند.