Xiaomi کا نیا MiMo-V2-Flash ماڈل، جو کہ 309 بلین پیرامیٹرز پر مشتمل mixture-of-experts (MoE) سسٹم ہے، اب 73.4% درستگی کے ساتھ SWE-Bench پر اوپن سورس لیڈر بورڈ پر سرفہرست ہے، جبکہ یہ موازنہ کرنے والے دیگر ماڈلز کے مقابلے میں 1/50 سے بھی کم کمپیوٹ استعمال کرتا ہے۔ یہ نتیجہ ظاہر کرتا ہے کہ اعلیٰ درجے کی کارکردگی ان بھاری بھرکم توانائی کے اخراجات کے بغیر بھی ممکن ہے جو کہ بڑے لینگویج ماڈلز (large-language-model) کی تحقیق کے لیے ایک معمول بن چکے ہیں۔
Xiaomi نے MoE کا انتخاب کیوں کیا
MoE آرکیٹیکچر ایک مشترکہ بیک بون (backbone) کے ساتھ کئی "ایکسپرٹ" (expert) سب نیٹ ورکس منسلک کر کے اخراجات سے بچتا ہے۔ یہ ماڈل مکمل 309 B پیرامیٹرز کو محفوظ رکھتا ہے لیکن ہر ٹوکن کے لیے صرف تقریباً 15 B کو فعال کرتا ہے۔ یہ منتخب فعال کاری (selective activation) انفرنس میموری اور کمپیوٹ کو نمایاں طور پر کم کر دیتی ہے، جس سے ماڈل FP16 موڈ میں 618 GB VRAM کے ساتھ تقریباً دس H100 GPUs پر چل سکتا ہے۔
وہ انجینئرنگ کے طریقے جو اسے عملی بناتے ہیں
- Hybrid attention pattern – زیادہ تر لیئرز sliding-window attention کا استعمال کرتی ہیں، جو attention matrix کو ہر ٹوکن کے گرد ایک تنگ بینڈ تک محدود رکھتی ہیں۔ ہر چھٹی لیئر global attention پر منتقل ہو جاتی ہے، جو میموری پر بوجھ ڈالے بغیر طویل فاصلے کے انحصار (long-range dependencies) کو محفوظ کرتی ہے۔ یہ پیٹرن میموری کے استعمال کو چھ گنا کم کر دیتا ہے۔
- Fast decoding module – ایک بلٹ ان پریڈکٹر (predictor) ایک ہی فارورڈ پاس میں کئی ٹوکنز جاری کرتا ہے، جو معیاری autoregressive decoding کے مقابلے میں 2.6 گنا تک زیادہ تیز جنریشن اسپیڈ فراہم کرتا ہے۔
- 256 K context window – یہ آرکیٹیکچر چوتھائی ملین ٹوکنز کے ان پٹ کو قبول کر سکتا ہے، جو کہ کوڈ بیسز، تحقیقی مقالوں، یا کسی بھی طویل دستاویز کے لیے مفید ہے۔
یہ اجزاء ماڈل کو ایسے ہارڈ ویئر پر استعمال کے قابل رکھتے ہیں جو کہ عام طور پر 309 B اسکیل کے سسٹم کے لیے پہنچ سے باہر ہوتا۔
Multi-Teacher On-Policy Distillation (MOPD)
MOPD اسٹوڈنٹ ماڈل—MiMo-V2-Flash—کو کئی ماہر اساتذہ (teachers) کا استعمال کرتے ہوئے تربیت دیتا ہے: ایک ریاضی کے لیے، دوسرا پروگرامنگ کے لیے، اور اسی طرح۔ جب کہ اسٹوڈنٹ ماڈل اپنے جوابات خود تیار کرتا ہے، اسے تمام اساتذہ سے ایک ساتھ فیڈ بیک ملتا ہے۔ چونکہ اسٹوڈنٹ اس تقسیم (distribution) سے سیکھتا ہے جو وہ حقیقت میں پیدا کرے گا، اس لیے ڈسٹلیشن (distillation) مستحکم رہتی ہے اور علم کی منتقلی حقیقی دنیا کے کاموں پر مرکوز رہتی ہے۔
MOPD روایتی طریقوں کے مقابلے میں 1/50 سے بھی کم کمپیوٹ استعمال کرتا ہے۔
بینچ مارک کارکردگی
| بینچ مارک | اسکور |
|---|---|
| SWE-Bench (coding) | 73.4% |
| GPQA-Diamond (general QA) | 83.7% |
| MMLU-Pro (multitask language understanding) | 84.9% |
| Arena-Hard (adversarial chat) | 86.2% |
باقی ماندہ توازن (trade-offs)
MoE کی بچت کے باوجود، MiMo-V2-Flash کو چلانا کوئی معمولی کام نہیں ہے۔ اسے چلانے کے لیے اب بھی تقریباً دس H100 GPUs کی ضرورت ہوتی ہے، اور 618 GB VRAM کی ضرورت اس ماڈل کو تیز رفتار انٹر کنیکٹس (interconnects) والے ڈیٹا سینٹر کے ماحول تک محدود رکھتی ہے۔
آگے کیا دیکھنے کو ملے گا
خلاصہ: MiMo-V2-Flash یہ ثابت کرتا ہے کہ ذہین ٹریننگ پائپ لائنز اور ماڈیولر آرکیٹیکچر ان بے پناہ کمپیوٹ اخراجات کے بغیر بھی اعلیٰ درجے کی کارکردگی فراہم کر سکتے ہیں جنہوں نے برسوں سے بڑے لینگویج ماڈلز کی ترقی کی تعریف کی ہے۔ اگلی رکاوٹ اس کارکردگی کو اتنا سستا بنانا ہے کہ یہ صرف بڑے فنڈز رکھنے والی لیبارٹریوں تک محدود نہ رہے۔
