一个拥有 1500 亿参数的混合专家(Mixture-of-Experts, MoE)模型可以在标准的开发者笔记本电脑上生成文本。实验表明,真正的性能瓶颈是 RAM(内存),而非 SSD(固态硬盘)的速度。这一点至关重要,因为它证明了前沿规模的模型可以在本地进行测试,而无需支付云端计算费用。

测试过程

我们使用开源的 Colibrì 推理引擎运行了 DeepSeek V4 Flash 模型——这是一个经过 REAP 剪枝的 1500 亿参数 MoE 模型。硬件配置为搭载 AMD Ryzen AI 9 365 的笔记本电脑,配备 61 GB RAM 和 1 TB NVMe SSD。我们对为期三分钟的生成运行进行了计时,并记录了每一次磁盘访问。

数据揭示了什么

  • 磁盘活动极少。 在三分钟的生成过程中,SSD 的读取时间不足 11 秒。即使硬盘能够瞬间读取数据,总吞吐量也只能提高约 6%。
  • RAM 容量直接影响速度。 将 RAM 缓存减半会导致吞吐量下降约 15%。CPU 在处理缓存未命中(包括反量化、复制和管理数据)上花费的时间,几乎与等待磁盘读取的时间一样多。

这些数据推翻了人们普遍认为存储带宽是笔记本电脑上大模型推理主要瓶颈的观点。

为什么 RAM 比 SSD 更重要

当模型参数尚未驻留在 RAM 中时,系统必须:

  1. 从 SSD 中提取数据。
  2. 对其进行解码并将其移入 CPU 寄存器以进行计算。

这两个步骤都会消耗周期。第一步受限于 SSD 的带宽;第二步会增加大致相同的延迟,因为无论数据到达速度有多快,CPU 都必须对数据进行反量化(de-quantise)。因此,更快的 SSD 带来的收益递减,而更多的 RAM 可以让更多的模型参数驻留在内存中,从而消除昂贵的往返传输。

对开发者的启示

  • 投资内存,而非存储。
  • 本地测试变得可行。 开发者可以在现有机器上运行开源权重的 MoE 模型,在无需支付云端额度的情况下,检查模型风格、工具调用(tool-calling)行为和输出质量。
  • 批量评估变得现实。 虽然实时聊天可能仍会感到迟钝,但队列任务(例如为研究生成数十个提示词)在笔记本电脑上运行起来非常轻松。

可能的反驳观点

有人可能会认为,对于需要反复加载新专家权重的负载,SSD 延迟仍然很重要。

下一步关注点

  • 内存高效的模型变体。
  • 具有更大片上缓存(on-chip caches)的硬件。
  • 软件层面的缓存策略。

结论很明确:想要在笔记本电脑上尝试大规模 MoE 模型的开发者应该购买更多的 RAM。升级 SSD 只能缩减百分之几的时间,而增加内存则可以将推理时间缩减两位数百分比。这改变了 AI 原型设计的成本计算方式,并为本地、零成本测试那些此前被认为需要专用云集群的模型打开了大门。