Xiaomi యొక్క కొత్త MiMo-V2-Flash మోడల్, 309 బిలియన్ పారామీటర్ల mixture-of-experts (MoE) సిస్టమ్, ఇప్పుడు SWE-Bench లోని ఓపెన్-సోర్స్ లీడర్బోర్డ్లో 73.4% ఖచ్చితత్వంతో అగ్రస్థానంలో ఉంది. ఇది సమానమైన మోడళ్లతో పోలిస్తే 1/50వ వంతు కంటే తక్కువ కంప్యూట్ (compute) మాత్రమే ఉపయోగిస్తుంది. పెద్ద భాషా నమూనాల (large-language-model) పరిశోధనలో సాధారణంగా ఎదురయ్యే భారీ విద్యుత్ ఖర్చుల అవసరం లేకుండానే అత్యుత్తమ పనితీరును సాధించవచ్చని ఈ ఫలితం చూపుతోంది.
Xiaomi ఎందుకు MoE వైపు మళ్లింది
MoE ఆర్కిటెక్చర్ ఒకే షేర్డ్ బ్యాక్బోన్కు (shared backbone) అనేక "ఎక్స్పర్ట్" సబ్-నెట్వర్క్లను అనుసంధానించడం ద్వారా ఖర్చును తగ్గిస్తుంది. ఈ మోడల్ మొత్తం 309 B పారామీటర్లను నిల్వ చేస్తుంది, కానీ ప్రతి టోకెన్ (token) కోసం కేవలం 15 B పారామీటర్లను మాత్రమే యాక్టివేట్ చేస్తుంది. ఈ ఎంపిక చేసిన యాక్టివేషన్ (selective activation) వల్ల ఇన్ఫరెన్స్ మెమరీ మరియు కంప్యూట్ గణనీయంగా తగ్గుతాయి, దీనివల్ల ఈ మోడల్ను FP16 మోడ్లో 618 GB VRAM కలిగిన సుమారు పది H100 GPUs పై నడపవచ్చు.
దీనిని ఆచరణాత్మకంగా మార్చే ఇంజనీరింగ్ ట్రిక్స్
- Hybrid attention pattern – చాలా లేయర్లు sliding-window attentionను ఉపయోగిస్తాయి, ఇది అటెన్షన్ మ్యాట్రిక్స్ను ప్రతి టోకెన్ చుట్టూ ఉన్న ఇరుకైన బ్యాండ్కు పరిమితం చేస్తుంది. ప్రతి ఆరో లేయర్ global attentionకు మారుతుంది, ఇది మెమరీని పెంచకుండానే సుదూర సంబంధాలను (long-range dependencies) గుర్తిస్తుంది. ఈ పద్ధతి మెమరీ వినియోగాన్ని ఆరు రెట్లు తగ్గిస్తుంది.
- Fast decoding module – ఇందులో ఉన్న బిల్ట్-ఇన్ ప్రిడిక్టర్ (predictor) ఒకే ఫార్వర్డ్ పాస్లో (forward pass) అనేక టోకెన్లను విడుదల చేస్తుంది, ఇది ప్రామాణిక autoregressive decoding కంటే 2.6 రెట్లు ఎక్కువ జనరేషన్ వేగాన్ని అందిస్తుంది.
- 256 K context window – ఈ ఆర్కిటెక్చర్ పావు మిలియన్ టోకెన్ల ఇన్పుట్లను స్వీకరించగలదు, ఇది కోడ్బేస్లు (codebases), పరిశోధనా పత్రాలు లేదా ఏదైనా సుదీర్ఘమైన డాక్యుమెంట్లకు ఉపయోగకరంగా ఉంటుంది.
ఈ అంశాల వల్ల, 309 B-స్కేల్ సిస్టమ్కు సాధారణంగా అందుబాటులో లేని హార్డ్వేర్పై కూడా ఈ మోడల్ను ఉపయోగించవచ్చు.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD అనేది స్టూడెంట్ మోడల్—MiMo-V2-Flash—ను అనేక ప్రత్యేకమైన టీచర్స్ (teachers) ఉపయోగించి శిక్షణ ఇస్తుంది: ఒకటి గణితం కోసం, మరొకటి ప్రోగ్రామింగ్ కోసం, మరియు ఇలాగే మరిన్ని. స్టూడెంట్ తన స్వంత ప్రతిస్పందనలను రూపొందించుకుంటున్న సమయంలో, అది ఒకేసారి అన్ని టీచర్స్ నుండి ఫీడ్బ్యాక్ అందుకుంటుంది. స్టూడెంట్ తాను వాస్తవంగా ఉత్పత్తి చేసే డిస్ట్రిబ్యూషన్ (distribution) నుండి నేర్చుకోవడం వల్ల, డిస్టిలేషన్ స్థిరంగా ఉంటుంది మరియు నాలెడ్జ్ ట్రాన్స్ఫర్ (knowledge transfer) వాస్తవ ప్రపంచ పనులపై దృష్టి పెడుతుంది.
సాంప్రదాయ పద్ధతులకు అవసరమైన కంప్యూట్ కంటే MOPD 1/50వ వంతు కంటే తక్కువ మాత్రమే వినియోగిస్తుంది.
Benchmark performance
| Benchmark | Score |
|---|---|
| SWE-Bench (coding) | 73.4 % |
| GPQA-Diamond (general QA) | 83.7 % |
| MMLU-Pro (multitask language understanding) | 84.9 % |
| Arena-Hard (adversarial chat) | 86.2 % |
ఇంకా మిగిలి ఉన్న సవాళ్లు (trade-offs)
MoE వల్ల పొదుపు ఉన్నప్పటికీ, MiMo-V2-Flashను నడపడం అనేది ల్యాప్టాప్లో చేసే పని కాదు. దీనిని అమలు చేయడానికి (Deployments) ఇప్పటికీ సుమారు పది H100 GPUs అవసరం, మరియు 618 GB VRAM అవసరం వల్ల ఈ మోడల్ హై-స్పీడ్ ఇంటర్కనెక్ట్లు (high-speed interconnects) ఉన్న డేటా-సెంటర్ వాతావరణానికి మాత్రమే పరిమితం అవుతుంది.
తదుపరి ఏం చూడాలి
ముఖ్య అంశం (Takeaway): తెలివైన ట్రైనింగ్ పైప్లైన్లు (training pipelines) మరియు మోడ్యులర్ ఆర్కిటెక్చర్ల ద్వారా, గత కొన్నేళ్లుగా large-language-model అభివృద్ధిలో ఎదురవుతున్న భారీ కంప్యూట్ ఖర్చుల అవసరం లేకుండానే అత్యుత్తమ పనితీరును అందించవచ్చని MiMo-V2-Flash నిరూపిస్తోంది. తదుపరి సవాలు ఏమిటంటే, ఈ పనితీరును కేవలం భారీ నిధులు ఉన్న ల్యాబ్లకే కాకుండా, అందరికీ అందుబాటులోకి తీసుకురావడం.
