مدل جدید MiMo-V2-Flash شیائومی، یک سیستم Mixture-of-Experts (MoE) با ۳۰۹ میلیارد پارامتر، اکنون با دقت ۷۳.۴٪ در صدر جدول ردهبندی متنباز SWE-Bench قرار گرفته است، در حالی که کمتر از ۱/۵۰ از توان محاسباتی مدلهای مشابه را مصرف میکند. این نتیجه نشان میدهد که دستیابی به عملکرد سطح بالا بدون هزینههای عظیم انرژی که به هنجار تحقیقات مدلهای زبانی بزرگ تبدیل شده است، امکانپذیر است.
چرا شیائومی به سراغ MoE رفت
معماری MoE با اتصال زیرشبکههای «متخصص» (expert) متعدد به یک ستون فقرات (backbone) مشترک، از هزینهها میکاهد. این مدل تمام ۳۰۹ میلیارد پارامتر را ذخیره میکند، اما برای هر توکن تنها حدود ۱۵ میلیارد پارامتر را فعال میسازد. این فعالسازی انتخابی، حافظه و محاسبات استنتاج (inference) را به شدت کاهش میدهد و اجازه میدهد مدل با حدود ده عدد GPU مدل H100 و ۶۱۸ گیگابایت VRAM در حالت FP16 اجرا شود.
ترفندهای مهندسی که آن را کاربردی میکند
- الگوی توجه ترکیبی (Hybrid attention pattern) – اکثر لایهها از توجه پنجره لغزان (sliding-window attention) استفاده میکنند که ماتریس توجه را به یک باند باریک در اطراف هر توکن محدود میکند. هر ششمین لایه به توجه سراسری (global attention) تغییر وضعیت میدهد تا وابستگیهای دوربرد را بدون اشغال بیش از حد حافظه، ثبت کند. این الگو مصرف حافظه را تا ۶ برابر کاهش میدهد.
- ماژول رمزگشایی سریع (Fast decoding module) – یک پیشبین داخلی، چندین توکن را در یک گذر مستقیم (forward pass) واحد صادر میکند که سرعت تولید را تا ۲.۶ برابر بیشتر از رمزگشایی خودبازگشتی (autoregressive) استاندارد افزایش میدهد.
- پنجره بافت (context window) ۲۵۶ هزارتایی – این معماری ورودیهایی تا ربع میلیون توکن را پردازش میکند که برای پایگاههای کد (codebases)، مقالات پژوهشی یا هر سند طولانی دیگری مفید است.
این اجزا باعث میشوند مدل روی سختافزاری قابل استفاده باشد که در غیر این صورت، برای یک سیستم در مقیاس ۳۰۹ میلیارد پارامتری غیرقابل دسترس میبود.
تقطیر درون-سیاست چند-معلمی (MOPD)
روش MOPD مدل دانشآموز (MiMo-V2-Flash) را با استفاده از چندین معلم متخصص آموزش میدهد: یکی برای ریاضیات، دیگری برای برنامهنویسی و غیره. در حالی که دانشآموز پاسخهای خود را تولید میکند، همزمان از تمام معلمان بازخورد دریافت میکند. از آنجایی که دانشآموز از توزیعی یاد میگیرد که در واقعیت تولید خواهد کرد، فرآیند تقطیر (distillation) پایدار میماند و انتقال دانش بر وظایف دنیای واقعی متمرکز باقی میماند.
MOPD کمتر از ۱/۵۰ از محاسبات مورد نیاز روشهای سنتی را مصرف میکند.
عملکرد در بنچمارکها
| بنچمارک | امتیاز |
|---|---|
| SWE-Bench (کدنویسی) | ۷۳.۴٪ |
| GPQA-Diamond (پرسش و پاسخ عمومی) | ۸۳.۷٪ |
| MMLU-Pro (درک زبان چندوظیفهای) | ۸۴.۹٪ |
| Arena-Hard (چت تقابلی) | ۸۶.۲٪ |
چالشها و محدودیتهای باقیمانده
حتی با صرفهجوییهای حاصل از MoE، اجرای MiMo-V2-Flash کاری نیست که با یک لپتاپ انجام شود. استقرار این مدل همچنان به حدود ده عدد GPU مدل H100 نیاز دارد و نیاز به ۶۱۸ گیگابایت VRAM، مدل را به محیطهای مرکز داده با اتصالات بینگرهای (interconnects) پرسرعت محدود میکند.
آنچه باید در آینده زیر نظر داشت
نکته کلیدی: MiMo-V2-Flash ثابت میکند که خط لولههای (pipelines) آموزشی هوشمندانه و معماریهای ماژولار میتوانند بدون هزینههای محاسباتی سرسامآوری که سالها توسعه مدلهای زبانی بزرگ را تعریف کرده است، عملکردی در سطح بالا ارائه دهند. مانع بعدی، مقرونبهصرفه کردن این عملکرد برای همه، فراتر از آزمایشگاههای دارای بودجههای کلان است.
