Xiaomi-இன் புதிய MiMo-V2-Flash மாடல், 309 பில்லியன் அளவுருக்களைக் (parameters) கொண்ட ஒரு mixture-of-experts (MoE) அமைப்பாகும். இது SWE-Bench-இன் திறந்த மூல (open-source) தரவரிசைப் பட்டியலில் 73.4% துல்லியத்துடன் முதலிடம் பிடித்துள்ளது; அதே நேரத்தில் ஒப்பிடத்தக்க மாடல்களை விட 1/50 பங்குக்கும் குறைவான கணக்கீட்டுத் திறனை (compute) மட்டுமே பயன்படுத்துகிறது. பெரிய மொழி மாதிரிகளின் (large-language-model) ஆராய்ச்சியில் வழக்கமாகிவிட்ட மிகப்பெரிய மின்சாரச் செலவுகள் இன்றி, மிகச்சிறந்த செயல்திறனைப் பெற முடியும் என்பதை இந்த முடிவு காட்டுகிறது.
Xiaomi ஏன் MoE-ஐத் தேர்ந்தெடுத்தது
ஒரு MoE கட்டமைப்பு (architecture), ஒரு பொதுவான முதுகெலும்புடன் (backbone) பல "நிபுணர்" (expert) துணை-நெட்வொர்க்குகளை இணைப்பதன் மூலம் செலவைக் குறைக்கிறது. இந்த மாடல் முழுமையான 309 B அளவுருக்களைச் சேமித்து வைத்திருந்தாலும், ஒவ்வொரு டோக்கனுக்கும் (token) சுமார் 15 B அளவுருக்களை மட்டுமே செயல்படுத்துகிறது. இந்தத் தேர்ந்தெடுக்கப்பட்ட செயல்பாடானது, அனுமான நினைவகம் (inference memory) மற்றும் கணக்கீட்டுத் தேவையை வெகுவாகக் குறைக்கிறது, இதனால் இந்த மாடலை FP16 முறையில் 618 GB VRAM கொண்ட சுமார் பத்து H100 GPUs-களில் இயக்க முடியும்.
இதனை நடைமுறைப்படுத்துவதற்கான பொறியியல் நுணுக்கங்கள்
- Hybrid attention pattern – பெரும்பாலான அடுக்குகைகள் (layers) sliding-window attention முறையைப் பயன்படுத்துகின்றன, இது attention matrix-ஐ ஒவ்வொரு டோக்கனுக்கும் அருகிலுள்ள ஒரு குறுகிய எல்லைக்குள் மட்டுப்படுத்துகிறது. ஒவ்வொரு ஆறாவது அடுக்கும் global attention முறைக்கு மாறுகிறது, இது நினைவகத்தை (memory) அதிகப்படியாகப் பயன்படுத்தாமல் நீண்ட தூரத் தொடர்புகளை (long-range dependencies) கண்டறிய உதவுகிறது. இந்த முறை நினைவகப் பயன்பாட்டை ஆறு மடங்கு குறைக்கிறது.
- Fast decoding module – இதில் உள்ள ஒரு predictor, ஒரே ஒரு forward pass-இல் பல டோக்கன்களை வெளியிடுகிறது, இது நிலையான autoregressive decoding முறையை விட 2.6 மடங்கு அதிக உற்பத்தி வேகத்தை (generation speed) வழங்குகிறது.
- 256 K context window – இந்த கட்டமைப்பு கால் மில்லியன் டோக்கன்கள் வரையிலான உள்ளீடுகளை (inputs) உள்வாங்கிக்கொள்ளும் திறன் கொண்டது, இது codebase-கள், ஆராய்ச்சித் தாள்கள் அல்லது எந்தவொரு நீண்ட ஆவணத்திற்கும் பயனுள்ளதாக இருக்கும்.
இந்த கூறுகள், 309 B அளவிலான ஒரு அமைப்பிற்கு வழக்கமாக எட்ட முடியாத வன்பொருள்களிலேயே (hardware) இந்த மாடலை பயன்படுத்தக்கூடியதாக வைக்கின்றன.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD என்பது பல சிறப்பு ஆசிரியர்களைப் பயன்படுத்தி மாணவர் மாடலை (student model)—MiMo-V2-Flash—பயிற்சி அளிக்கிறது: ஒன்று கணிதத்திற்கு, மற்றொன்று புரோகிராமிங்கிற்கு எனப் பல ஆசிரியர்கள் உள்ளனர். மாணவர் மாடல் தனது சொந்தப் பதில்களை உருவாக்கும்போது, அனைத்து ஆசிரியர்களிடமிருந்தும் ஒரே நேரத்தில் பின்னூட்டத்தைப் (feedback) பெறுகிறது. மாணவர் மாடல் தான் உண்மையில் உருவாக்கும் விநியோகத்திலிருந்து (distribution) கற்றுக்கொள்வதால், இந்த distillation முறை நிலையானதாகவும், அறிவுப் பரிமாற்றம் நிஜ உலகப் பணிகளில் கவனம் செலுத்துவதாகவும் அமைகிறது.
பாரம்பரிய முறைகளுக்குத் தேவைப்படும் கணக்கீட்டுத் திறனில் (compute) 1/50 பங்குக்கும் குறைவாகவே MOPD பயன்படுத்துகிறது.
Benchmark செயல்திறன்
| Benchmark | மதிப்பெண் (Score) |
|---|---|
| SWE-Bench (coding) | 73.4 % |
| GPQA-Diamond (general QA) | 83.7 % |
| MMLU-Pro (multitask language understanding) | 84.9 % |
| Arena-Hard (adversarial chat) | 86.2 % |
எஞ்சியுள்ள சவால்கள் (Trade-offs)
MoE மூலம் சேமிப்பு கிடைத்தாலும், MiMo-V2-Flash-ஐ இயக்குவது ஒரு சாதாரண லேப்டாப்பில் செய்யக்கூடிய காரியம் அல்ல. இதனைப் பயன்படுத்த இன்னும் சுமார் பத்து H100 GPUs தேவைப்படுகின்றன, மேலும் 618 GB VRAM தேவை என்பது இந்த மாடலை அதிவேக இணைப்பு வசதிகள் கொண்ட தரவு மைய (data-center) சூழல்களுக்குள் மட்டுமே வரச் செய்கிறது.
அடுத்து கவனிக்க வேண்டியவை
முக்கியக் கருத்து (Takeaway): பல ஆண்டுகளாக பெரிய மொழி மாதிரிகளின் வளர்ச்சியைத் தீர்மானித்த அதீத கணக்கீட்டுச் செலவுகள் இன்றி, புத்திசாலித்தனமான பயிற்சி முறைகள் (training pipelines) மற்றும் மாடுலர் கட்டமைப்புகள் (modular architectures) மூலம் மிகச்சிறந்த செயல்திறனை வழங்க முடியும் என்பதை MiMo-V2-Flash நிரூபிக்கிறது. அடுத்த சவால், இந்தச் செயல்திறனைப் பெரும் நிதி வசதி கொண்ட ஆய்வகங்களைத் தாண்டி, மற்றவர்களும் பயன்படுத்தும் வகையில் மலிவாக மாற்றுவதாகும்.
