Xiaomi ਦਾ ਨਵਾਂ MiMo-V2-Flash ਮਾਡਲ, ਜੋ ਕਿ 309 ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ mixture-of-experts (MoE) ਸਿਸਟਮ ਹੈ, ਹੁਣ 73.4% ਸ਼ੁੱਧਤਾ (accuracy) ਦੇ ਨਾਲ SWE-Bench 'ਤੇ open-source ਲੀਡਰਬੋਰਡ ਵਿੱਚ ਸਭ ਤੋਂ ਉੱਪਰ ਹੈ, ਜਦੋਂ ਕਿ ਇਹ ਸਮਾਨ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ 1/50ਵੇਂ ਤੋਂ ਵੀ ਘੱਟ ਕੰਪਿਊਟ (compute) ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਇਹ ਨਤੀਜਾ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਉੱਚ-ਪੱਧਰੀ ਪ੍ਰਦਰਸ਼ਨ ਉਹਨਾਂ ਭਾਰੀ ਊਰਜਾ ਬਿੱਲਾਂ ਤੋਂ ਬਿਨਾਂ ਵੀ ਸੰਭਵ ਹੈ ਜੋ large-language-model ਖੋਜ ਲਈ ਇੱਕ ਆਮ ਗੱਲ ਬਣ ਗਈ ਹੈ।
Xiaomi ਨੇ MoE ਦੀ ਚੋਣ ਕਿਉਂ ਕੀਤੀ
ਇੱਕ MoE ਆਰਕੀਟੈਕਚਰ ਇੱਕ ਸਾਂਝੇ backbone ਨਾਲ ਕਈ "expert" sub-networks ਨੂੰ ਜੋੜ ਕੇ ਲਾਗਤ ਨੂੰ ਘਟਾ ਦਿੰਦਾ ਹੈ। ਮਾਡਲ ਪੂਰੇ 309 B ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਸਟੋਰ ਕਰਦਾ ਹੈ ਪਰ ਹਰੇਕ token ਲਈ ਸਿਰਫ਼ ਲਗਭਗ 15 B ਨੂੰ ਹੀ ਐਕਟੀਵੇਟ ਕਰਦਾ ਹੈ। ਇਹ ਚੋਣਵੇਂ ਐਕਟੀਵੇਸ਼ਨ ਨਾਲ inference memory ਅਤੇ compute ਵਿੱਚ ਭਾਰੀ ਕਟੌਤੀ ਹੁੰਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ FP16 ਮੋਡ ਵਿੱਚ 618 GB VRAM ਵਾਲੇ ਲਗਭਗ ਦਸ H100 GPUs 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ।
ਇੰਜੀਨੀਅਰਿੰਗ ਦੇ ਉਹ ਤਰੀਕੇ ਜੋ ਇਸਨੂੰ ਵਿਹਾਰਕ ਬਣਾਉਂਦੇ ਹਨ
- Hybrid attention pattern – ਜ਼ਿਆਦਾਤਰ ਲੇਅਰਾਂ sliding-window attention ਦੀ ਵਰਤੋਂ ਕਰਦੀਆਂ ਹਨ, ਜੋ attention matrix ਨੂੰ ਹਰੇਕ token ਦੇ ਆਲੇ-ਦੁਆਲੇ ਇੱਕ ਤੰਗ ਬੈਂਡ ਤੱਕ ਸੀਮਤ ਕਰਦੀਆਂ ਹਨ। ਹਰ ਛੇਵੀਂ ਲੇਅਰ global attention ਵਿੱਚ ਬਦਲ ਜਾਂਦੀ ਹੈ, ਜੋ ਮੈਮੋਰੀ ਨੂੰ ਵਧਾਏ ਬਿਨਾਂ ਲੰਬੇ ਸਮੇਂ ਦੀਆਂ dependencies ਨੂੰ ਕੈਪਚਰ ਕਰਦੀ ਹੈ। ਇਹ ਪੈਟਰਨ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਨੂੰ ਛੇ ਗੁਣਾ ਘਟਾ ਦਿੰਦਾ ਹੈ।
- Fast decoding module – ਇੱਕ built-in predictor ਇੱਕ ਸਿੰਗਲ forward pass ਵਿੱਚ ਕਈ tokens ਜਾਰੀ ਕਰਦਾ ਹੈ, ਜੋ standard autoregressive decoding ਨਾਲੋਂ 2.6× ਤੱਕ ਵਧੇਰੇ generation speed ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- 256 K context window – ਇਹ ਆਰਕੀਟੈਕਚਰ ਪੌਣ-ਲੱਖ (quarter-million) token ਇਨਪੁੱਟਸ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰ ਸਕਦਾ ਹੈ, ਜੋ codebases, ਰਿਸਰਚ ਪੇਪਰਾਂ, ਜਾਂ ਕਿਸੇ ਵੀ ਲੰਬੇ ਦਸਤਾਵੇਜ਼ ਲਈ ਉਪਯੋਗੀ ਹੈ।
ਇਹ ਕੰਪੋਨੈਂਟ ਮਾਡਲ ਨੂੰ ਅਜਿਹੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਵਰਤੋਂ ਯੋਗ ਬਣਾਉਂਦੇ ਹਨ ਜੋ ਆਮ ਤੌਰ 'ਤੇ 309 B-scale ਸਿਸਟਮ ਲਈ ਪਹੁੰਚ ਤੋਂ ਬਾਹਰ ਹੁੰਦਾ।
Multi-Teacher On-Policy Distillation (MOPD)
MOPD ਵਿਦਿਆਰਥੀ ਮਾਡਲ (student model)—MiMo-V2-Flash—ਨੂੰ ਕਈ ਵਿਸ਼ੇਸ਼ ਅਧਿਆਪਕਾਂ (teachers) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਸਿਖਾਉਂਦਾ ਹੈ: ਇੱਕ ਗਣਿਤ ਲਈ, ਦੂਜਾ ਪ੍ਰੋਗਰਾਮਿੰਗ ਲਈ, ਅਤੇ ਇਸੇ ਤਰ੍ਹਾਂ ਹੋਰ। ਜਦੋਂ ਵਿਦਿਆਰਥੀ ਆਪਣੇ ਜਵਾਬ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਤਾਂ ਉਸਨੂੰ ਇੱਕੋ ਸਮੇਂ ਸਾਰੇ ਅਧਿਆਪਕਾਂ ਤੋਂ ਫੀਡਬੈਕ ਮਿਲਦਾ ਹੈ। ਕਿਉਂਕਿ ਵਿਦਿਆਰਥੀ ਉਸੇ ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ (distribution) ਤੋਂ ਸਿੱਖਦਾ ਹੈ ਜੋ ਉਹ ਅਸਲ ਵਿੱਚ ਪੈਦਾ ਕਰੇਗਾ, ਇਸ ਲਈ distillation ਸਥਿਰ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਗਿਆਨ ਦਾ ਤਬਾਦਲਾ (knowledge transfer) ਅਸਲ ਦੁਨੀਆ ਦੇ ਕੰਮਾਂ 'ਤੇ ਕੇਂਦਰਿਤ ਰਹਿੰਦਾ ਹੈ।
MOPD ਰਵਾਇਤੀ ਤਰੀਕਿਆਂ ਦੁਆਰਾ ਲੋੜੀਂਦੇ ਕੰਪਿਊਟ (compute) ਦੇ 1/50ਵੇਂ ਤੋਂ ਵੀ ਘੱਟ ਹਿੱਸਾ ਵਰਤਦਾ ਹੈ।
Benchmark ਪ੍ਰਦਰਸ਼ਨ
| Benchmark | ਸਕੋਰ (Score) |
|---|---|
| SWE-Bench (coding) | 73.4 % |
| GPQA-Diamond (general QA) | 83.7 % |
| MMLU-Pro (multitask language understanding) | 84.9 % |
| Arena-Hard (adversarial chat) | 86.2 % |
ਬਾਕੀ ਰਹੇ ਸਮਝੌਤੇ (Trade-offs)
MoE ਦੀ ਬਚਤ ਦੇ ਬਾਵਜੂਦ, MiMo-V2-Flash ਨੂੰ ਚਲਾਉਣਾ ਕੋਈ ਲੈਪਟਾਪ ਵਾਲਾ ਕੰਮ ਨਹੀਂ ਹੈ। ਇਸ ਨੂੰ ਚਲਾਉਣ ਲਈ ਅਜੇ ਵੀ ਲਗਭਗ ਦਸ H100 GPUs ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਅਤੇ 618 GB VRAM ਦੀ ਲੋੜ ਮਾਡਲ ਨੂੰ ਉੱਚ-ਗਤੀ ਵਾਲੇ interconnects ਵਾਲੇ ਡਾਟਾ-ਸੈਂਟਰ ਵਾਤਾਵਰਣ ਤੱਕ ਸੀਮਤ ਕਰਦੀ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਸਿੱਖਿਆ (Takeaway): MiMo-V2-Flash ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਚਲਾਕ ਟ੍ਰੇਨਿੰਗ ਪਾਈਪਲਾਈਨਾਂ ਅਤੇ ਮੋਡਿਊਲਰ ਆਰਕੀਟੈਕਚਰਾਂ ਨਾਲ ਉਹਨਾਂ ਭਾਰੀ ਕੰਪਿਊਟ ਲਾਗਤਾਂ ਤੋਂ ਬਿਨਾਂ ਉੱਚ-ਪੱਧਰੀ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਦਾਨ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਨੇ ਸਾਲਾਂ ਤੋਂ large-language-model ਵਿਕਾਸ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਹੈ। ਅਗਲੀ ਚੁਣੌਤੀ ਉਸ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਅਜਿਹਾ ਕਿਫਾਇਤੀ ਬਣਾਉਣਾ ਹੈ ਜੋ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫੰਡ ਪ੍ਰਾਪਤ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ (labs) ਤੋਂ ਇਲਾਵਾ ਕਿਸੇ ਲਈ ਵੀ ਉਪਲਬਧ ਹੋ ਸਕੇ।
