Xiaomi-യുടെ പുതിയ MiMo-V2-Flash മോഡൽ, 309 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു mixture-of-experts (MoE) സിസ്റ്റമാണ്. ഇത് 73.4% കൃത്യതയോടെ SWE-Bench-ലെ ഓപ്പൺ സോഴ്സ് ലീഡർബോർഡിന്റെ മുൻനിരയിൽ എത്തിയിരിക്കുന്നു; ഒപ്പം സമാനമായ മോഡലുകളെ അപേക്ഷിച്ച് 1/50-ൽ താഴെ കമ്പ്യൂട്ട് മാത്രം ഉപയോഗിക്കുന്നു. ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) ഗവേഷണങ്ങളിൽ സാധാരണയായി കാണാറുള്ള വൻതോതിലുള്ള ഊർജ്ജ ഉപഭോഗമില്ലാതെ തന്നെ മികച്ച പ്രകടനം കാഴ്ചവെക്കാൻ സാധിക്കുമെന്ന് ഈ ഫലം തെളിയിക്കുന്നു.
എന്തുകൊണ്ടാണ് Xiaomi MoE തിരഞ്ഞെടുത്തത്
ഒരു പങ്കിട്ട ബാക്ക്ബോണിലേക്ക് (shared backbone) നിരവധി "എക്സ്പെർട്ട്" സബ്-നെറ്റ്വർക്കുകളെ ഘടിപ്പിക്കുന്നതിലൂടെ MoE ആർക്കിടെക്ചർ ചിലവ് കുറയ്ക്കുന്നു. ഈ മോഡൽ മുഴുവൻ 309 B പാരാമീറ്ററുകളും സംഭരിക്കുന്നുണ്ടെങ്കിലും, ഓരോ ടോക്കണിനും ഏകദേശം 15 B പാരാമീറ്ററുകൾ മാത്രമാണ് സജീവമാക്കുന്നത്. ഈ സെലക്റ്റീവ് ആക്ടിവേഷൻ ഇൻഫറൻസ് മെമ്മറിയും കമ്പ്യൂട്ടും ഗണ്യമായി കുറയ്ക്കുന്നു, ഇത് FP16 മോഡിൽ 618 GB VRAM ഉള്ള ഏകദേശം പത്ത് H100 GPUs-ൽ മോഡൽ പ്രവർത്തിപ്പിക്കാൻ സഹായിക്കുന്നു.
ഇതിനെ പ്രായോഗികമാക്കുന്ന എഞ്ചിനീയറിംഗ് വിദ്യകൾ
- Hybrid attention pattern – മിക്ക ലെയറുകളും സ്ലൈഡിംഗ്-വിൻഡോ അറ്റൻഷൻ (sliding-window attention) ഉപയോഗിക്കുന്നു, ഇത് ഓരോ ടോക്കണിന് ചുറ്റുമുള്ള ഒരു ചെറിയ പരിധിയിലേക്ക് മാത്രം അറ്റൻഷൻ മാട്രിക്സിനെ പരിമിതപ്പെടുത്തുന്നു. ഓരോ ആറാം ലെയറും ഗ്ലോബൽ അറ്റൻഷനിലേക്ക് മാറുന്നു, ഇത് മെമ്മറി അമിതമായി ഉപയോഗിക്കാതെ തന്നെ ദീർഘദൂര ബന്ധങ്ങൾ (long-range dependencies) തിരിച്ചറിയാൻ സഹായിക്കുന്നു. ഈ രീതി മെമ്മറി ഉപയോഗം ആറിരട്ടി കുറയ്ക്കുന്നു.
- Fast decoding module – ഇതിൽ ഉൾപ്പെടുത്തിയിട്ടുള്ള ഒരു പ്രെഡിക്റ്റർ (predictor) ഒറ്റ ഫൊർവേഡ് പാസ്സിലൂടെ (forward pass) ഒന്നിലധികം ടോക്കണുകൾ പുറപ്പെടുവിക്കുന്നു, ഇത് സാധാരണ ഓട്ടോറഗ്രസീവ് ഡീകോഡിംഗിനേക്കാൾ (autoregressive decoding) 2.6 മടങ്ങ് വരെ ഉയർന്ന ജനറേഷൻ വേഗത നൽകുന്നു.
- 256 K context window – ഈ ആർക്കിടെക്ചറിന് കാൽ ദശലക്ഷം ടോക്കണുകൾ വരെയുള്ള ഇൻപുട്ടുകൾ സ്വീകരിക്കാൻ കഴിയും, ഇത് കോഡ്ബേസുകൾക്കോ, ഗവേഷണ പ്രബന്ധങ്ങൾക്കോ അല്ലെങ്കിൽ മറ്റേതെങ്കിലും വലിയ ഡോക്യുമെന്റുകൾക്കോ വളരെ ഉപകാരപ്രദമാണ്.
ഈ ഘടകങ്ങൾ കാരണം, സാധാരണഗതിയിൽ ഒരു 309 B-സ്കെയിൽ സിസ്റ്റത്തിന് ഉപയോഗിക്കാൻ കഴിയാത്ത ഹാർഡ്വെയറുകളിൽ പോലും ഈ മോഡൽ പ്രവർത്തിപ്പിക്കാൻ സാധിക്കുന്നു.
Multi-Teacher On-Policy Distillation (MOPD)
ഗണിതം, പ്രോഗ്രാമിംഗ് എന്നിങ്ങനെ വിവിധ വിഷയങ്ങളിൽ വൈദഗ്ധ്യമുള്ള നിരവധി 'ടീച്ചർമാരെ' ഉപയോഗിച്ചാണ് MOPD സ്റ്റുഡന്റ് മോഡലിനെ—MiMo-V2-Flash—പരിശീലിപ്പിക്കുന്നത്. സ്റ്റുഡന്റ് മോഡൽ സ്വന്തമായി മറുപടികൾ തയ്യാറാക്കുമ്പോൾ തന്നെ, എല്ലാ ടീച്ചർമാരിൽ നിന്നും ഒരേസമയം ഫീഡ്ബാക്ക് ലഭിക്കുന്നു. സ്റ്റുഡന്റ് മോഡൽ യഥാർത്ഥത്തിൽ ഉൽപ്പാദിപ്പിക്കാൻ പോകുന്ന ഡാറ്റാ ഡിസ്ട്രിബ്യൂഷനിൽ (distribution) നിന്ന് തന്നെ പഠിക്കുന്നതുകൊണ്ട്, ഈ ഡിസ്റ്റിലേഷൻ (distillation) സ്ഥിരതയുള്ളതാകുകയും അറിവ് കൈമാറ്റം യഥാർത്ഥ ലോകത്തെ ജോലികളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുകയും ചെയ്യുന്നു.
പരമ്പരാഗത രീതികൾക്ക് ആവശ്യമായ കമ്പ്യൂട്ടിന്റെ 1/50-ൽ താഴെ മാത്രമേ MOPD ഉപയോഗിക്കുന്നുള്ളൂ.
ബെഞ്ച്മാർക്ക് പ്രകടനം
| ബെഞ്ച്മാർക്ക് | സ്കോർ |
|---|---|
| SWE-Bench (coding) | 73.4 % |
| GPQA-Diamond (general QA) | 83.7 % |
| MMLU-Pro (multitask language understanding) | 84.9 % |
| Arena-Hard (adversarial chat) | 86.2 % |
നിലനിൽക്കുന്ന പരിമിതികൾ (Trade-offs)
MoE വഴി ലാഭമുണ്ടാക്കുന്നുണ്ടെങ്കിലും, MiMo-V2-Flash പ്രവർത്തിപ്പിക്കുന്നത് ഒരു ലാപ്ടോപ്പിൽ ചെയ്യാവുന്ന ലളിതമായ കാര്യമല്ല. ഇത് പ്രവർത്തിപ്പിക്കാൻ ഇപ്പോഴും ഏകദേശം പത്ത് H100 GPUs ആവശ്യമാണ്, കൂടാതെ 618 GB VRAM ആവശ്യകത ഈ മോഡലിനെ ഹൈ-സ്പീഡ് ഇന്റർകണക്റ്റുകളുള്ള ഡാറ്റാ സെന്റർ പരിതസ്ഥിതികളിലേക്ക് മാത്രമായി പരിമിതപ്പെടുത്തുന്നു.
ഇനി എന്താണ് ശ്രദ്ധിക്കേണ്ടത്
ചുരുക്കത്തിൽ: വർഷങ്ങളായി ലാർജ് ലാംഗ്വേജ് മോഡൽ വികസനത്തിന്റെ പ്രധാന വെല്ലുവിളിയായ അമിതമായ കമ്പ്യൂട്ട് ചിലവില്ലാതെ തന്നെ, മികച്ച പരിശീലന രീതികളിലൂടെയും (training pipelines) മോഡുലാർ ആർക്കിടെക്ചറുകളിലൂടെയും ഉന്നതനിലവാരത്തിലുള്ള പ്രകടനം കാഴ്ചവെക്കാൻ കഴിയുമെന്ന് MiMo-V2-Flash തെളിയിക്കുന്നു. വലിയ ഫണ്ട് ലഭിക്കുന്ന ലാബുകൾക്ക് പുറത്തുള്ളവർക്കും ഈ സാങ്കേതികവിദ്യ താങ്ങാനാവുന്ന രീതിയിൽ ലഭ്യമാക്കുക എന്നതാണ് അടുത്ത വെല്ലുവിളി.
