โมเดล MiMo-V2-Flash ใหม่ของ Xiaomi ซึ่งเป็นระบบ mixture-of-experts (MoE) ขนาด 309 พันล้านพารามิเตอร์ ขณะนี้ครองอันดับหนึ่งบนตารางผู้นำโอเพนซอร์สของ SWE-Bench ด้วยความแม่นยำ 73.4% โดยใช้พลังการประมวลผลน้อยกว่าโมเดลที่ใกล้เคียงกันถึงไม่ถึง 1/50 ผลลัพธ์นี้แสดงให้เห็นว่าประสิทธิภาพระดับแนวหน้าสามารถเป็นไปได้โดยไม่ต้องเผชิญกับค่าใช้จ่ายด้านพลังงานมหาศาลซึ่งกลายเป็นเรื่องปกติสำหรับการวิจัยโมเดลภาษาขนาดใหญ่ (large-language-model)

ทำไม Xiaomi ถึงหันมาใช้ MoE

สถาปัตยกรรม MoE ช่วยหลีกเลี่ยงต้นทุนโดยการเชื่อมต่อเครือข่ายย่อยแบบ "ผู้เชี่ยวชาญ" (expert) จำนวนมากเข้ากับโครงสร้างหลัก (backbone) ที่ใช้ร่วมกัน โมเดลจะจัดเก็บพารามิเตอร์ทั้งหมด 309 พันล้านพารามิเตอร์ แต่จะเปิดใช้งานเพียงประมาณ 15 พันล้านพารามิเตอร์สำหรับแต่ละโทเคน (token) การเปิดใช้งานแบบเลือกสรรนี้ช่วยลดหน่วยความจำและพลังการประมวลผลในการอนุมาน (inference) อย่างมหาศาล ทำให้โมเดลสามารถทำงานบน H100 GPU ประมาณ 10 ตัว พร้อม VRAM ขนาด 618 GB ในโหมด FP16 ได้

กลเม็ดทางวิศวกรรมที่ทำให้ใช้งานได้จริง

  • Hybrid attention pattern – เลเยอร์ส่วนใหญ่ใช้ sliding-window attention ซึ่งจำกัดเมทริกซ์ความสนใจ (attention matrix) ให้อยู่ในแถบแคบๆ รอบแต่ละโทเคน โดยทุกๆ เลเยอร์ที่หกจะสลับไปใช้ global attention เพื่อจับความสัมพันธ์ระยะไกล (long-range dependencies) โดยไม่ทำให้การใช้หน่วยความจำพุ่งสูงขึ้น รูปแบบนี้ช่วยลดการใช้หน่วยความจำลงถึง 6 เท่า
  • Fast decoding module – ตัวทำนาย (predictor) ที่ติดตั้งมาในตัวจะส่งโทเคนออกมาหลายตัวในการส่งผ่านข้อมูลเพียงครั้งเดียว (single forward pass) ทำให้มีความเร็วในการสร้างข้อความสูงกว่าการถอดรหัสแบบ autoregressive มาตรฐานถึง 2.6 เท่า
  • 256 K context window – สถาปัตยกรรมนี้สามารถรับอินพุตได้ถึงหนึ่งในสี่ล้านโทเคน ซึ่งมีประโยชน์สำหรับชุดรหัส (codebases) งานวิจัย หรือเอกสารขนาดยาวใดๆ

ส่วนประกอบเหล่านี้ช่วยให้โมเดลสามารถใช้งานบนฮาร์ดแวร์ที่หากเป็นระบบขนาด 309 พันล้านพารามิเตอร์ทั่วไปอาจจะเกินเอื้อมไปแล้ว

Multi-Teacher On-Policy Distillation (MOPD)

MOPD ฝึกฝนโมเดลนักเรียน (student model) ซึ่งก็คือ MiMo-V2-Flash โดยใช้ "ครู" (teachers) ผู้เชี่ยวชาญเฉพาะทางหลายคน เช่น ครูด้านคณิตศาสตร์ ครูด้านการเขียนโปรแกรม และอื่นๆ ในขณะที่โมเดลนักเรียนสร้างคำตอบของตัวเอง มันจะได้รับคำติชมจากครูทุกคนพร้อมกัน เนื่องจากโมเดลนักเรียนเรียนรู้จากรูปแบบการกระจายข้อมูล (distribution) ที่มันจะผลิตออกมาจริงๆ การกลั่นกรองความรู้ (distillation) จึงมีความเสถียร และการถ่ายทอดความรู้ยังคงมุ่งเน้นไปที่งานในโลกแห่งความเป็นจริง

MOPD ใช้พลังการประมวลผลน้อยกว่า 1/50 ของวิธีการแบบดั้งเดิม

Benchmark performance

Benchmark คะแนน
SWE-Bench (การเขียนโค้ด) 73.4%
GPQA-Diamond (QA ทั่วไป) 83.7%
MMLU-Pro (ความเข้าใจภาษาแบบหลายงาน) 84.9%
Arena-Hard (การแชทแบบเผชิญหน้า) 86.2%

ข้อแลกเปลี่ยนที่ยังคงมีอยู่

แม้จะมีการประหยัดด้วย MoE แต่การรัน MiMo-V2-Flash ก็ไม่ใช่เรื่องที่จะทำบนแล็ปท็อปได้ การติดตั้งใช้งานยังคงต้องใช้ H100 GPU ประมาณ 10 ตัว และข้อกำหนด VRAM ขนาด 618 GB ทำให้โมเดลนี้จำกัดอยู่เฉพาะในสภาพแวดล้อมของดาต้าเซ็นเตอร์ที่มีการเชื่อมต่อความเร็วสูง (high-speed interconnects) เท่านั้น

สิ่งที่ต้องจับตามองต่อไป

บทสรุป: MiMo-V2-Flash พิสูจน์ให้เห็นว่า pipeline การฝึกฝนที่ชาญฉลาดและสถาปัตยกรรมแบบโมดูลาร์สามารถมอบประสิทธิภาพระดับแนวหน้าได้ โดยไม่ต้องมีต้นทุนการประมวลผลที่พุ่งสูงเกินควบคุมอย่างที่เป็นมาในการพัฒนาโมเดลภาษาขนาดใหญ่ตลอดหลายปีที่ผ่านมา อุปสรรคต่อไปคือการทำให้ประสิทธิภาพดังกล่าวมีราคาที่เข้าถึงได้สำหรับทุกคน นอกเหนือไปจากห้องปฏิบัติการที่มีเงินทุนสนับสนุนมหาศาล