Nvidia 发布 Nemotron 3.5 Lightning:30B MoE 仅 3B 激活,面向 Agent 执行层的开源推理模型
Nvidia 于 8 月 11 日发布 Nemotron 3.5 Lightning:30B 参数、仅 3B 激活的混合 MoE 开源模型,NVFP4 量化版同步上线 Hugging Face,主打低延迟推理与 Agent 执行层场景,PinchBench 达 86%。这是 Nemotron 系列在"执行而非思考"定位下的新成员,延续 Nvidia 在开源模型领域的持续布局。
事件与背景
2026 年 8 月 11 日,Nvidia 发布 Nemotron 3.5 Lightning——一个 30B 参数、仅 3B 激活的混合 Mixture-of-Experts(MoE)开源语言模型,并在 Hugging Face 同步上线 NVFP4 量化版(NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4)。Nvidia NIM 提供生产级部署入口,datanorth 等第三方评测称其在 PinchBench 上达到 86%。
关键事实
| 项目 | 详情 |
|---|---|
| 总参数 | 30B |
| 激活参数 | 3B(A3B MoE) |
| 架构 | 交错 Mamba-2 与 MoE 层 + 选择性 Attention 层 |
| 发布渠道 | Hugging Face + NVIDIA NIM |
| 量化 | NVFP4 |
| 定位 | Agent 执行层(低延迟工具调用) |
技术机制或行业解释
Nemotron 3.5 Lightning 采用混合 MoE 架构:交错排列 Mamba-2 状态空间层与 MoE 前馈层,并加入少量选择性 Attention 层。相比稠密模型,MoE 结构让每个 token 只激活 3B 参数,推理计算量大幅下降;Mamba-2 层的线性复杂度进一步降低长上下文成本。NVFP4 是 Nvidia 面向 Hopper/Blackwell 的 4-bit 浮点量化格式,能把显存占用压到可单卡部署的水平。这种"总参大、激活小"的设计专门服务 Agent 高频、低延迟的工具调用场景,与追求深度思考的大推理模型形成互补。
影响与意义
对开源模型生态,Nemotron 3.5 Lightning 是 Nvidia 继 Nemotron 3 Ultra 之后又一次开源布局,目标直指"Agent 执行层"这一增长最快的推理负载;对开发者,30B-A3B + NVFP4 的组合意味着可以在单卡上部署低延迟推理服务,降低 Agent 应用的算力门槛;对模型选型,它提供了"按任务分工"的新思路——思考交给大模型、执行交给小激活模型,为多层模型路由架构提供开源选项。
风险边界
3B 激活的参数规模限制了复杂推理能力,官方定位就是"执行层"而非全能模型;PinchBench 86% 是单点评测,需对比工具调用与代码执行的实际成功率;Mamba-2 架构与主流 transformer 推理栈的兼容性、量化精度损失需要实测;开源许可与商用条款需以 HF 模型卡为准。
后续观察
关注社区对 Nemotron 3.5 Lightning 在真实 Agent 任务上的评测结果;对比其与 Qwen、Llama 同级开源模型的工具调用能力;跟踪 Nvidia 是否推出更大激活参数的"思考层"开源模型,补全执行/思考双模型策略;观察 NVFP4 在 vLLM、llama.cpp 等推理框架的适配进度。
AI Master 解读
核心事件
Nvidia 8/11 发布 Nemotron 3.5 Lightning,30B 参数、3B 激活的 MoE 开源模型,面向 Agent 执行层。
行业影响
为什么重要: 30B 总参 + 3B 激活意味着推理成本大幅低于同规模稠密模型,配合 NVFP4 量化可部署在单卡消费级硬件上。Nvidia 明确把模型定位为 Agent 的"执行层"而非"思考层"——在需要低延迟、高频调用的工具调用与代码执行场景,这类小激活模型比大推理模型更划算。这是开源模型走向"按 Agent 任务分工"的信号,与 Anthropic、OpenAI 的闭源模型形成差异化竞争。
AI Master 建议
评估 Agent 工具调用与低延迟推理场景时,把 Nemotron 3.5 Lightning 加入候选名单,对比其与 Qwen、Llama 同级模型的 PinchBench/工具调用实测;关注 NVFP4 量化在自有推理栈上的兼容性。
