小米全新的 MiMo-V2-Flash 模型是一个拥有 3090 亿参数的混合专家 (MoE) 系统,目前在 SWE-Bench 开源排行榜上以 73.4% 的准确率位居榜首,而其计算量仅为同类模型的 1/50 以下。这一结果表明,无需承担大型语言模型研究中已成常态的巨额能源账单,也能实现顶尖性能。
为什么小米转向 MoE
MoE 架构通过在共享主干网络上附加许多“专家”子网络来规避成本。该模型存储全部 3090 亿参数,但每个 token 仅激活约 150 亿参数。这种选择性激活大幅降低了推理内存和计算量,使得该模型可以在 FP16 模式下,利用约 618 GB 显存的 10 台左右 H100 GPU 上运行。
使其具备实用性的工程技巧
- 混合注意力模式 (Hybrid attention pattern) – 大多数层使用滑动窗口注意力 (sliding-window attention),将注意力矩阵限制在每个 token 周围的窄带内。每六层切换一次全局注意力 (global attention),在不大幅增加内存消耗的情况下捕捉长程依赖关系。该模式将内存占用降低了六倍。
- 快速解码模块 (Fast decoding module) – 内置的预测器可以在单次前向传播中输出多个 token,其生成速度比标准的自回归解码 (autoregressive decoding) 高出多达 2.6 倍。
- 256 K 上下文窗口 – 该架构可以处理 25 万 token 的输入,适用于代码库、研究论文或任何长文档。
这些组件使得该模型能够在原本无法运行 3090 亿规模系统的硬件上使用。
多教师在策略蒸馏 (Multi-Teacher On-Policy Distillation, MOPD)
MOPD 使用许多专门的“教师”模型来训练学生模型——MiMo-V2-Flash:例如一个负责数学,另一个负责编程,以此类推。在学生模型生成自身响应的同时,它会同时接收来自所有教师模型的反馈。由于学生模型是从其自身实际产生的分布中学习,因此蒸馏过程保持稳定,且知识迁移始终聚焦于现实世界的任务。
MOPD 消耗的计算量不到传统方法所需的 1/50。
基准测试性能
| 基准测试 | 分数 |
|---|---|
| SWE-Bench (编程) | 73.4 % |
| GPQA-Diamond (通用问答) | 83.7 % |
| MMLU-Pro (多任务语言理解) | 84.9 % |
| Arena-Hard (对抗性对话) | 86.2 % |
仍然存在的权衡
即使有了 MoE 的节省,运行 MiMo-V2-Flash 也并非笔记本电脑就能胜任的任务。部署仍需要大约 10 台 H100 GPU,且 618 GB 显存的要求将该模型限制在具有高速互连的数据中心环境中。
下一步值得关注的方向
核心启示: MiMo-V2-Flash 证明了巧妙的训练流水线和模块化架构可以提供顶尖性能,而无需承担多年来定义大语言模型开发的失控计算成本。下一个障碍是如何让这种性能变得足够经济,从而让资金充足的实验室之外的任何人都能负担得起。
