Nemotron 3.5 Lightning 发布:NVIDIA 开源 30B 智能体模型,输出提速 4 倍

8 月 11 日,NVIDIA 发布了 Nemotron 3 系列的新成员 Nemotron 3.5 Lightning,同时放出了配套的开源模型路由库 NeMo Switchyard。官方把这款模型定位为「同级别中运行长时智能体工作负载效率最高的开源模型」,面向 always-on agent 里的高频细分任务:代码审查、工具调用、安全告警监控、账单问答。

30B 总参数、3B 激活,单卡就能跑

Nemotron 3.5 Lightning 是 30B 总参数、3B 激活的混合专家模型,采用 Mamba-2、MoE 和 Attention 交错的混合架构,上下文最高支持 100 万 token。官方提供 BF16 和 NVFP4 两个量化版本,NVFP4 版本单张 DGX Spark(GB10)或 H100 即可部署,也支持 RTX 5090、GB200 等 Blackwell 硬件。许可证是 OpenMDW-1.1,允许商用。

预训练数据截止到 2025 年 9 月,后训练数据截止到 2026 年 5 月。NVIDIA 照例把训练数据和配方一并公开,这次还额外发布了用于后训练的智能体强化学习数据集 Nemotron-RL-Agentic-Terminal-Pivot。

官方 benchmark:输出速度最高 4 倍

NVIDIA 的数据:相比同类模型,输出速度最高提升 4 倍,智能体任务完成时间缩短约 30%。benchmark 方面,PinchBench 得分 83.43,SWE-bench Verified 52.80,MMLU Pro 81.62,GPQA Diamond(无工具)75.57,BrowseComp 36.81。这些数字来自 NVIDIA 自己的评测流程,和厂商自报的数据可能不完全一致。

第一批合作伙伴已经在用:CrowdStrike 用在网络安全,Harvey 联合 Trajectory 做法律业务,CodeRabbit 和 Baseten 做代码审查,Lila Sciences 用在物理和生命科学领域。Fastino Labs 在软件开发、金融和医疗负载上做了定制,报告说达到了不错的准确率。

NeMo Switchyard:把请求路由给最合适的模型

Switchyard 是一个用 Rust 写的开源代理和库,Apache 2.0 许可,代码在 GitHub 上。它能做 OpenAI Chat、Anthropic Messages、OpenAI Responses 三种协议之间的互转,把请求分发给不同后端,内置随机路由、LLM 分类路由、信号驱动路由等算法,也支持自己写路由逻辑。目前标注为 pre-alpha,官方明确说不适合生产环境。

路由的卖点是省成本。NVIDIA 内部数据显示,用 Switchyard 保持前沿级准确率的同时,任务成本能降到只用 Opus 4.8 的约三分之一。合作方的数据:LangChain 在 145 个多轮 Deep Agents 任务里把成本降了 74%(只把 7% 的调用路由给前沿模型,准确率损失 6%),Ramp 在自家 SWE-Bench 上成本降 58%、运行时间降 33%,Cognition 把 staged router 集成进了 Devin Desktop,平均成本降 28%。Nous Research 把 Switchyard 集成进了 Hermes。

定价和获取方式

模型已经上架 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com(NIM 微服务)。OpenRouter 上的参考价是输入 0.10 美元、输出 0.25 美元每百万 token(约合 ¥0.73 / ¥1.83),另外还有上下文 100 万 token 的免费版本。想本地跑的话,RTX PC、DGX Spark、DGX Station 和 Jetson 都支持。

为什么值得关注

开源智能体模型这个赛道最近很热闹。Meta 在 8 月 11 日开源了 30B 的端侧智能体模型 Muse Glimmer,NVIDIA 这边 Nemotron 3 系列从 Nano 一路铺到 Lightning,都在 30B 这个量级做文章。30B 总参、3B 激活的配置让这类模型能跑在个人硬件上,MoE 架构又保证了吞吐。对做 agent 产品的团队来说,模型本身之外,路由层的成本优化可能是更实际的变量。