Nvidia 于 8 月 11 日发布了 Nemotron 3.5 Lightning。这款拥有 300 亿参数的混合专家(MoE)模型在运行时仅需 30 亿个激活参数,而其配套的 NeMo Switchyard 路由库已经引发了关于推理成本和缓存效率的争论。Switchyard 在模型之间调度请求的方式可能会破坏提示词缓存(prompt caches),并可能使单次推理会话的费用翻倍。
为开源权重智能体打造的模型
Nemotron 3.5 Lightning 针对的是需要调用工具、验证结果并保留推理轨迹的 AI 智能体。三个技术选择使其脱颖而出:
- 混合架构 – 它将 Mamba-2 状态空间核心与传统的 Transformer 相融合,证明了非 Transformer 设计在这一规模下也能具备竞争力。
- 4 位浮点量化 – 通过低精度发布,使得该 30B 模型在 M5 Max MacBook Pro 上能以每秒约 100 个 token 的速度运行,这是全精度模型难以企及的速度。
- 完全开放 – Nvidia 发布了权重文件和完整的训练方案,这对于旨在实现高性能推理的模型来说非常罕见。
早期用户表示,该模型可能会“过度思考”,输出冗长的推理链,有时甚至会出现错误。开发者获得了一个强大且开源可用的智能体执行器,但必须谨慎编写提示词,以避免不必要的冗长。
为什么路由层至关重要
NeMo Switchyard 是 Nvidia 的一个库,用于在候选模型池中动态地将请求路由到“最佳”模型。理论上,路由器可以通过为每个查询选择专家模型来提高回答质量。但在实践中,路由决策会与许多推理流水线所依赖的提示词缓存机制发生冲突。
- 提示词缓存 (Prompt caches) 存储初始提示词的 token 嵌入,以便后续生成可以重复使用它们,而无需重新计算“预填充 (prefill)”步骤。
- 路由切换 (Routing swaps) 在生成前几个 token 后将请求从模型 A 转移到模型 B,迫使系统丢弃已缓存的提示词,并为新模型从头开始重新计算。
由于大多数 AI 开销都花在读取缓存的提示词而非生成新 token 上,因此一次路由跳转实际上会使请求成本翻倍。
成本的拉锯战
未来展望
这场争论发生之际,正值 Nvidia 的开源权重策略面临直接竞争。8 月 15 日,Qwen 3.8-27B 将发布,早期基准测试表明,在本地开发场景中,它能够与 Nemotron 3.5 Lightning 旗鼓相当。
Nvidia 的模式——开源权重、开源训练方案和开源路由层——看起来旨在使其 GPU 成为任何在本地运行这些模型的人的默认硬件。通过开放软件栈,Nvidia 希望将开发者锁定在其生态系统中,即使路由逻辑会增加隐藏的成本惩罚。
总结
如果你计划在自己的机器上运行 Nemotron 3.5 Lightning,不仅要问“它的生成速度有多快?”,还要问“Switchyard 会多频繁地迫使我丢弃提示词缓存?”这个答案将决定该模型的开源权重承诺是能带来现实世界的节省,还是会变成一场昂贵的实验。随着 Qwen 等替代方案的出现,路由灵活性与缓存驱动的成本效率之间的平衡,将决定哪种工具包——以及最终哪种硬件平台——能够胜出。
