مدل جدید MiMo-V2-Flash شیائومی، یک سیستم Mixture-of-Experts (MoE) با ۳۰۹ میلیارد پارامتر، اکنون با دقت ۷۳.۴٪ در صدر جدول رده‌بندی متن‌باز SWE-Bench قرار گرفته است، در حالی که کمتر از ۱/۵۰ از توان محاسباتی مدل‌های مشابه را مصرف می‌کند. این نتیجه نشان می‌دهد که دستیابی به عملکرد سطح بالا بدون هزینه‌های عظیم انرژی که به هنجار تحقیقات مدل‌های زبانی بزرگ تبدیل شده است، امکان‌پذیر است.

چرا شیائومی به سراغ MoE رفت

معماری MoE با اتصال زیرشبکه‌های «متخصص» (expert) متعدد به یک ستون فقرات (backbone) مشترک، از هزینه‌ها می‌کاهد. این مدل تمام ۳۰۹ میلیارد پارامتر را ذخیره می‌کند، اما برای هر توکن تنها حدود ۱۵ میلیارد پارامتر را فعال می‌سازد. این فعال‌سازی انتخابی، حافظه و محاسبات استنتاج (inference) را به شدت کاهش می‌دهد و اجازه می‌دهد مدل با حدود ده عدد GPU مدل H100 و ۶۱۸ گیگابایت VRAM در حالت FP16 اجرا شود.

ترفندهای مهندسی که آن را کاربردی می‌کند

  • الگوی توجه ترکیبی (Hybrid attention pattern) – اکثر لایه‌ها از توجه پنجره لغزان (sliding-window attention) استفاده می‌کنند که ماتریس توجه را به یک باند باریک در اطراف هر توکن محدود می‌کند. هر ششمین لایه به توجه سراسری (global attention) تغییر وضعیت می‌دهد تا وابستگی‌های دوربرد را بدون اشغال بیش از حد حافظه، ثبت کند. این الگو مصرف حافظه را تا ۶ برابر کاهش می‌دهد.
  • ماژول رمزگشایی سریع (Fast decoding module) – یک پیش‌بین داخلی، چندین توکن را در یک گذر مستقیم (forward pass) واحد صادر می‌کند که سرعت تولید را تا ۲.۶ برابر بیشتر از رمزگشایی خودبازگشتی (autoregressive) استاندارد افزایش می‌دهد.
  • پنجره بافت (context window) ۲۵۶ هزارتایی – این معماری ورودی‌هایی تا ربع میلیون توکن را پردازش می‌کند که برای پایگاه‌های کد (codebases)، مقالات پژوهشی یا هر سند طولانی دیگری مفید است.

این اجزا باعث می‌شوند مدل روی سخت‌افزاری قابل استفاده باشد که در غیر این صورت، برای یک سیستم در مقیاس ۳۰۹ میلیارد پارامتری غیرقابل دسترس می‌بود.

تقطیر درون-سیاست چند-معلمی (MOPD)

روش MOPD مدل دانش‌آموز (MiMo-V2-Flash) را با استفاده از چندین معلم متخصص آموزش می‌دهد: یکی برای ریاضیات، دیگری برای برنامه‌نویسی و غیره. در حالی که دانش‌آموز پاسخ‌های خود را تولید می‌کند، هم‌زمان از تمام معلمان بازخورد دریافت می‌کند. از آنجایی که دانش‌آموز از توزیعی یاد می‌گیرد که در واقعیت تولید خواهد کرد، فرآیند تقطیر (distillation) پایدار می‌ماند و انتقال دانش بر وظایف دنیای واقعی متمرکز باقی می‌ماند.

MOPD کمتر از ۱/۵۰ از محاسبات مورد نیاز روش‌های سنتی را مصرف می‌کند.

عملکرد در بنچمارک‌ها

بنچمارک امتیاز
SWE-Bench (کدنویسی) ۷۳.۴٪
GPQA-Diamond (پرسش و پاسخ عمومی) ۸۳.۷٪
MMLU-Pro (درک زبان چندوظیفه‌ای) ۸۴.۹٪
Arena-Hard (چت تقابلی) ۸۶.۲٪

چالش‌ها و محدودیت‌های باقی‌مانده

حتی با صرفه‌جویی‌های حاصل از MoE، اجرای MiMo-V2-Flash کاری نیست که با یک لپ‌تاپ انجام شود. استقرار این مدل همچنان به حدود ده عدد GPU مدل H100 نیاز دارد و نیاز به ۶۱۸ گیگابایت VRAM، مدل را به محیط‌های مرکز داده با اتصالات بین‌گره‌ای (interconnects) پرسرعت محدود می‌کند.

آنچه باید در آینده زیر نظر داشت

نکته کلیدی: MiMo-V2-Flash ثابت می‌کند که خط لوله‌های (pipelines) آموزشی هوشمندانه و معماری‌های ماژولار می‌توانند بدون هزینه‌های محاسباتی سرسام‌آوری که سال‌ها توسعه مدل‌های زبانی بزرگ را تعریف کرده است، عملکردی در سطح بالا ارائه دهند. مانع بعدی، مقرون‌به‌صرفه کردن این عملکرد برای همه، فراتر از آزمایشگاه‌های دارای بودجه‌های کلان است.