Nemotron 3 Nano 30B A3B 作为前身,已经定位为大型基础模型的紧凑型替代方案。通过转向混合 Mamba-Transformer 架构,并在任何时刻仅激活 36 亿个参数,Lightning 在推动效率边界的同时,仍能提供与大得多的模型相当的推理能力。

为什么速度在当下至关重要

AI Agent(智能体)正从批处理式推理转向持续交互。一个停顿数秒的聊天机器人会让人感到迟钝;一个落后于开发者输入速度的代码补全工具会破坏工作流。在这些场景中,每秒 Token 数(TPS)的吞吐量直接转化为感知的响应速度。670 token/s 的数值大约是 Google Gemini 3.5 Flash-Lite 报告的 386 token/s 的两倍,并将完成标准 Intelligence Index 任务的时间缩短至约半分钟。相比之下,完成相同任务,Qwen 3.6 35B A3B 需要 3.5 分钟,而 Gemma 4 31B 需要 5.8 分钟。

对于任何必须处理大量并发请求的服务来说,这种差距都至关重要。在相同的硬件上处理两倍 Token 数量的服务器既可以降低成本,也可以使容量翻倍,这对云服务提供商和企业来说是明显的优势。

该模型如何实现这些数据

Nemotron 3.5 Lightning 的混合架构将 Transformer 的长程模式识别优势与 Mamba 模块的状态空间效率结合在一起。该设计保持了较高的总参数量(316 亿)以保留建模能力,但在处理任何给定 Token 时,仅有 36 亿个参数处于激活状态。稀疏激活减少了每个 Token 的计算量,在不按比例损失质量的情况下提高了吞吐量。

Artificial Analysis 测得 Lightning 的 Intelligence Index 得分为 24 分,比早期的 Nano 模型(15 分)提高了 9 分。这使其与 OpenAI 的 gpt-oss-120b 旗鼓相当,尽管 Lightning 使用的参数量仅为其四分之一左右。它虽然仍落后于顶尖模型——Meta 的 Muse Glimmer (35) 和 Qwen 3.6 35B A3B (32)——但其智能/参数比位居前列。

Agentic 基准测试也说明了类似的情况

Agentic 工作负载(规划、工具使用、多步推理)是 Lightning 的闪光点。在 GDPval-AA v2 基准测试中,该模型的 Elo 评分为 824,超过了拥有 1200 亿参数的 gpt-oss-120b (800) 以及 Nvidia 自家规模更大的 Nemotron 3 Super (698)。在 Terminal-Bench v2.1 测试中,Lightning 的成功率从 7% 上升到 24.3%,接近了 gpt-oss-120b 创下的 26.2% 的记录。

Nvidia 将模型在特定领域任务上的调优归功于与 CodeRabbit 和 Harvey 等合作伙伴进行的训练后协作。这些优化使模型在保持高速的同时,在专业工作负载上保持竞争力。

可用性与实际考量

该模型采用宽松的 OpenMDW-1.1 许可证发布,权重提供 BF16 和 NVFP4 格式。NVFP4 变体以极小的质量损失实现了更紧凑的模型封装,是边缘部署或注重成本的云实例的一个实用选择。百万级 Token 的上下文窗口让模型能够处理极长的提示词而无需截断,这对于文档级分析或大规模代码库非常有用。

无服务器推理(Serverless inference)已在 DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius 和 Crusoe 等供应商平台上运行。开发者无需构建自定义基础设施即可开始实验,不过真正的成本效益将取决于各平台的定价。

核心结论: Nemotron 3.5 Lightning 证明了一个模型可以在达到 1200 亿参数系统推理水平的同时,提供几乎是领先竞争对手两倍的 Token 吞吐量,使其成为对延迟敏感的 AI Agent 的有力竞争者。