Xiaomi ನ ಹೊಸ MiMo-V2-Flash ಮಾಡೆಲ್, 309 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ಗಳಿರುವ mixture-of-experts (MoE) ವ್ಯವಸ್ಥೆಯಾಗಿದ್ದು, ಈಗ SWE-Bench ನ ಓಪನ್-ಸೋರ್ಸ್ ಲೀಡರ್ಬೋರ್ಡ್ನಲ್ಲಿ 73.4% ನಿಖರತೆಯೊಂದಿಗೆ ಅಗ್ರಸ್ಥಾನದಲ್ಲಿದೆ. ಇದು ಸಮಾನ ಮಾದರಿಗಳಿಗಿಂತ 1/50 ರಷ್ಟು ಕಡಿಮೆ ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಬಳಸುತ್ತದೆ. ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳ (large-language-model) ಸಂಶೋಧನೆಯಲ್ಲಿ ಸಾಮಾನ್ಯವಾಗಿದ್ದ ಬೃಹತ್ ಇಂಧನ ವೆಚ್ಚಗಳಿಲ್ಲದೆ ಅತ್ಯುತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸಲು ಸಾಧ್ಯ ಎಂಬುದನ್ನು ಈ ಫಲಿತಾಂಶವು ತೋರಿಸುತ್ತದೆ.
Xiaomi ಏಕೆ MoE ಕಡೆಗೆ ತಿರುಗಿತು
MoE ಆರ್ಕಿಟೆಕ್ಚರ್ ಒಂದು ಹಂಚಿಕೆಯ ಬ್ಯಾಕ್ಬೋನ್ (backbone) ಗೆ ಅನೇಕ "ಎಕ್ಸ್ಪರ್ಟ್" ಸಬ್-ನೆಟ್ವರ್ಕ್ಗಳನ್ನು ಜೋಡಿಸುವ ಮೂಲಕ ವೆಚ್ಚವನ್ನು ತಪ್ಪಿಸುತ್ತದೆ. ಈ ಮಾಡೆಲ್ ಪೂರ್ಣ 309 B ಪ್ಯಾರಾಮೀಟರ್ಗಳನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ ಆದರೆ ಪ್ರತಿ ಟೋಕನ್ಗಾಗಿ ಕೇವಲ ಸುಮಾರು 15 B ಅನ್ನು ಮಾತ್ರ ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. ಈ ಆಯ್ದ ಸಕ್ರಿಯಗೊಳಿಸುವಿಕೆಯು ಇನ್ಫರೆನ್ಸ್ ಮೆಮೊರಿ ಮತ್ತು ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಮಾಡೆಲ್ ಅನ್ನು FP16 ಮೋಡ್ನಲ್ಲಿ 618 GB VRAM ಹೊಂದಿರುವ ಸುಮಾರು ಹತ್ತು H100 GPU ಗಳಲ್ಲಿ ಚಲಾಯಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.
ಇದನ್ನು ಪ್ರಾಯೋಗಿಕವಾಗಿಸುವ ಎಂಜಿನಿಯರಿಂಗ್ ತಂತ್ರಗಳು
- Hybrid attention pattern – ಹೆಚ್ಚಿನ ಲೇಯರ್ಗಳು sliding-window attention ಅನ್ನು ಬಳಸುತ್ತವೆ, ಇದು ಅಟೆನ್ಷನ್ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಅನ್ನು ಪ್ರತಿ ಟೋಕನ್ನ ಸುತ್ತಲಿನ ಕಿರಿದಾದ ಪಟ್ಟಿಗೆ ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ. ಪ್ರತಿ ಆರನೇ ಲೇಯರ್ ಗ್ಲೋಬಲ್ ಅಟೆನ್ಷನ್ಗೆ ಬದಲಾಗುತ್ತದೆ, ಇದು ಮೆಮೊರಿಯನ್ನು ಅತಿಯಾಗಿ ಬಳಸದೆ ದೀರ್ಘಾವಧಿಯ ಅವಲಂಬನೆಗಳನ್ನು (long-range dependencies) ಸೆರೆಹಿಡಿಯುತ್ತದೆ. ಈ ಮಾದರಿಯು ಮೆಮೊರಿ ಬಳಕೆಯನ್ನು ಆರ ಪಟ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
- Fast decoding module – ಅಂತರ್ಗತ ಪ್ರೆಡಿಕ್ಟರ್ (predictor) ಒಂದೇ ಫಾರ್ವರ್ಡ್ ಪಾಸ್ನಲ್ಲಿ ಹಲವಾರು ಟೋಕನ್ಗಳನ್ನು ಹೊರಸೂಸುತ್ತದೆ, ಇದು ಪ್ರಮಾಣಿತ ಆಟೋರೆಗ್ರೆಸಿವ್ ಡಿಕೋಡಿಂಗ್ (autoregressive decoding) ಗಿಂತ 2.6× ಹೆಚ್ಚಿನ ಜನರೇಷನ್ ವೇಗವನ್ನು ನೀಡುತ್ತದೆ.
- 256 K context window – ಈ ಆರ್ಕಿಟೆಕ್ಚರ್ ಕಾಲು ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳ ಇನ್ಪುಟ್ಗಳನ್ನು ಸ್ವೀಕರಿಸುತ್ತದೆ, ಇದು ಕೋಡ್ಬೇಸ್ಗಳು, ಸಂಶೋಧನಾ ಪ್ರಬಂಧಗಳು ಅಥವಾ ಯಾವುದೇ ದೀರ್ಘ ದಾಖಲೆಗಳಿಗೆ ಉಪಯುಕ್ತವಾಗಿದೆ.
ಈ ಘಟಕಗಳು 309 B-ಸ್ಕೇಲ್ ವ್ಯವಸ್ಥೆಗೆ ಅಸಾಧ್ಯವಾಗಬಹುದಾದ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿಯೂ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸಲು ಸಾಧ್ಯವಾಗುವಂತೆ ಮಾಡುತ್ತವೆ.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD ವಿದ್ಯಾರ್ಥಿ ಮಾಡೆಲ್—MiMo-V2-Flash—ಅನ್ನು ಅನೇಕ ವಿಶೇಷ ಶಿಕ್ಷಕರನ್ನು ಬಳಸಿಕೊಂಡು ತರಬೇತಿಗೊಳಿಸುತ್ತದೆ: ಗಣಿತಕ್ಕಾಗಿ ಒಂದು, ಪ್ರೋಗ್ರಾಮಿಂಗ್ಗಾಗಿ ಇನ್ನೊಂದು, ಮತ್ತು ಹೀಗೆ ಮುಂದುವರಿಯುತ್ತದೆ. ವಿದ್ಯಾರ್ಥಿ ಮಾಡೆಲ್ ತನ್ನದೇ ಆದ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಸೃಷ್ಟಿಸುವಾಗ, ಅದು ಎಲ್ಲಾ ಶಿಕ್ಷಕರಿಂದ ಏಕಕಾಲದಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು (feedback) ಪಡೆಯುತ್ತದೆ. ವಿದ್ಯಾರ್ಥಿಯು ತಾನು ವಾಸ್ತವವಾಗಿ ಉತ್ಪಾದಿಸುವ ವಿತರಣೆಯಿಂದ (distribution) ಕಲಿಯುವುದರಿಂದ, ಡಿಸ್ಟಿಲೇಶನ್ ಸ್ಥಿರವಾಗಿರುತ್ತದೆ ಮತ್ತು ಜ್ಞಾನ ವರ್ಗಾವಣೆಯು ನೈಜ-ಪ್ರಪಂಚದ ಕಾರ್ಯಗಳ ಮೇಲೆ ಕೇಂದ್ರೀಕೃತವಾಗಿರುತ್ತದೆ.
ಸಾಮಪ್ರದಾಯಿಕ ವಿಧಾನಗಳಿಗೆ ಅಗತ್ಯವಿರುವ ಕಂಪ್ಯೂಟ್ನ 1/50 ರಷ್ಟು ಕಡಿಮೆ ಕಂಪ್ಯೂಟ್ ಅನ್ನು MOPD ಬಳಸುತ್ತದೆ.
ಬೆಂಚ್ಮಾರ್ಕ್ ಕಾರ್ಯಕ್ಷಮತೆ
| ಬೆಂಚ್ಮಾರ್ಕ್ | ಸ್ಕೋರ್ |
|---|---|
| SWE-Bench (coding) | 73.4 % |
| GPQA-Diamond (general QA) | 83.7 % |
| MMLU-Pro (multitask language understanding) | 84.9 % |
| Arena-Hard (adversarial chat) | 86.2 % |
ಉಳಿದಿರುವ ಸವಾಲುಗಳು (Trade-offs)
MoE ಉಳಿತಾಯವಿದ್ದರೂ ಸಹ, MiMo-V2-Flash ಅನ್ನು ಚಲಾಯಿಸುವುದು ಲ್ಯಾಪ್ಟಾಪ್ನಲ್ಲಿ ಮಾಡುವ ಕೆಲಸವಲ್ಲ. ಇದನ್ನು ಬಳಸಲು ಇಂದಿಗೂ ಸುಮಾರು ಹತ್ತು H100 GPUಗಳು ಬೇಕಾಗುತ್ತವೆ ಮತ್ತು 618 GB VRAM ಅಗತ್ಯತೆಯು ಮಾಡೆಲ್ ಅನ್ನು ಹೆಚ್ಚಿನ ವೇಗದ ಇಂಟರ್ಕನೆಕ್ಟ್ಗಳನ್ನು ಹೊಂದಿರುವ ಡೇಟಾ-ಸೆಂಟರ್ ಪರಿಸರಗಳಿಗೆ ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಮುಖ್ಯ ಅಂಶ: ಚತುರ ತರಬೇತಿ ಪೈಪ್ಲೈನ್ಗಳು ಮತ್ತು ಮಾಡ್ಯುಲರ್ ಆರ್ಕಿಟೆಕ್ಚರ್ಗಳು, ವರ್ಷಗಳಿಂದ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳ ಅಭಿವೃದ್ಧಿಯನ್ನು ನಿರ್ಧರಿಸಿದ ಅತಿಯಾದ ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚಗಳಿಲ್ಲದೆ ಉನ್ನತ ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡಬಲ್ಲವು ಎಂಬುದನ್ನು MiMo-V2-Flash ಸಾಬೀತುಪಡಿಸುತ್ತದೆ. ಮುಂದಿನ ಸವಾಲು ಎಂದರೆ, ಆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಉತ್ತಮವಾಗಿ ಹಣಕಾಸಿನ ನೆರವು ಹೊಂದಿರುವ ಪ್ರಯೋಗಾಲಯಗಳ ಹೊರತಾಗಿ ಉಳಿದವರಿಗೂ ಕೈಗೆಟುಕುವಂತೆ ಮಾಡುವುದು.
