Xiaomi का नया MiMo-V2-Flash मॉडल, जो कि 309 बिलियन-पैरामीटर वाला mixture-of-experts (MoE) सिस्टम है, अब 73.4% सटीकता के साथ SWE-Bench पर ओपन-सोर्स लीडरबोर्ड में शीर्ष पर है, जबकि यह तुलनात्मक मॉडलों की तुलना में 1/50वें से भी कम कंप्यूट का उपयोग करता है। यह परिणाम दर्शाता है कि बड़े भाषा मॉडल (large-language-model) अनुसंधान के लिए सामान्य बन चुके भारी ऊर्जा बिलों के बिना भी उत्कृष्ट प्रदर्शन संभव है।

Xiaomi ने MoE का रुख क्यों किया

एक MoE आर्किटेक्चर एक साझा बैकबोन (backbone) से कई "एक्सपर्ट" सब-नेटवर्क्स को जोड़कर लागत से बचता है। मॉडल सभी 309 B पैरामीटर्स को स्टोर करता है लेकिन प्रत्येक टोकन के लिए केवल लगभग 15 B को ही सक्रिय (activate) करता है। यह चयनात्मक सक्रियण (selective activation) इन्फरेंस मेमोरी और कंप्यूट को काफी कम कर देता है, जिससे मॉडल FP16 मोड में 618 GB VRAM वाले लगभग दस H100 GPUs पर चल सकता है।

वे इंजीनियरिंग ट्रिक्स जो इसे व्यावहारिक बनाती हैं

  • Hybrid attention pattern – अधिकांश लेयर्स sliding-window attention का उपयोग करती हैं, जो अटेंशन मैट्रिक्स को प्रत्येक टोकन के आसपास एक संकीर्ण बैंड तक सीमित कर देती हैं। हर छठी लेयर global attention पर स्विच हो जाती है, जो मेमोरी को बढ़ाए बिना लंबी दूरी की निर्भरताओं (long-range dependencies) को कैप्चर करती है। यह पैटर्न मेमोरी के उपयोग को छह गुना कम कर देता है।
  • Fast decoding module – एक इन-बिल्ट प्रेडिक्टर एक ही फॉरवर्ड पास में कई टोकन उत्सर्जित करता है, जो मानक autoregressive decoding की तुलना में 2.6× तक अधिक जनरेशन स्पीड प्रदान करता है।
  • 256 K context window – यह आर्किटेक्चर पाव चौथाई मिलियन (quarter-million) टोकन इनपुट ले सकता है, जो कोडबेस, रिसर्च पेपर या किसी भी लंबे दस्तावेज़ के लिए उपयोगी है।

ये घटक मॉडल को ऐसे हार्डवेयर पर उपयोग करने योग्य बनाए रखते हैं जो अन्यथा 309 B-स्केल सिस्टम के लिए पहुंच से बाहर होता।

Multi-Teacher On-Policy Distillation (MOPD)

MOPD कई विशेषज्ञ शिक्षकों (teachers) का उपयोग करके स्टूडेंट मॉडल—MiMo-V2-Flash—को प्रशिक्षित करता है: एक गणित के लिए, दूसरा प्रोग्रामिंग के लिए, इत्यादि। जबकि स्टूडेंट अपने स्वयं के उत्तर उत्पन्न करता है, उसे एक साथ सभी शिक्षकों से फीडबैक प्राप्त होता है। चूंकि स्टूडेंट उस वितरण (distribution) से सीखता है जिसे वह वास्तव में उत्पन्न करेगा, इसलिए डिस्टिलेशन (distillation) स्थिर रहता है और ज्ञान का हस्तांतरण वास्तविक दुनिया के कार्यों पर केंद्रित रहता है।

MOPD पारंपरिक तरीकों की तुलना में 1/50वें से भी कम कंप्यूट का उपयोग करता है।

बेंचमार्क प्रदर्शन

बेंचमार्क स्कोर
SWE-Bench (कोडिंग) 73.4 %
GPQA-Diamond (सामान्य QA) 83.7 %
MMLU-Pro (मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) 84.9 %
Arena-Hard (एडवर्सैरियल चैट) 86.2 %

जो समझौते (trade-offs) शेष हैं

MoE की बचत के बावजूद, MiMo-V2-Flash को चलाना कोई लैपटॉप वाला काम नहीं है। इसके परिनियोजन (deployment) के लिए अभी भी लगभग दस H100 GPUs की आवश्यकता होती है, और 618 GB VRAM की आवश्यकता इस मॉडल को हाई-स्पीड इंटरकनेक्ट्स वाले डेटा-सेंटर वातावरण तक ही सीमित रखती है।

आगे क्या देखने की आवश्यकता है

निष्कर्ष (Takeaway): MiMo-V2-Flash यह साबित करता है कि चतुर ट्रेनिंग पाइपलाइन और मॉड्यूलर आर्किटेक्चर, उन अनियंत्रित कंप्यूट लागतों के बिना शीर्ष स्तर का प्रदर्शन दे सकते हैं जिन्होंने वर्षों से बड़े भाषा मॉडल के विकास को परिभाषित किया है। अगली चुनौती उस प्रदर्शन को अच्छी तरह से वित्त पोषित प्रयोगशालाओं (well-funded labs) से परे किसी के लिए भी पर्याप्त किफायती बनाना है।