英伟达发布开放模型 Nemotron 3.5 Lightning,同日开源 NeMo Switchyard
NVIDIA 于 2026-08-11 发布 30B/3B 激活参数的开放模型 Nemotron 3.5 Lightning,并同日在 GitHub 开源模型路由库 NeMo Switchyard。本文梳理规格与硬件门槛,并标明哪些性能与成本数字属于厂商自报、第三方尚未复现。
NVIDIA 于 2026 年 8 月 11 日在官方博客发布开放模型 Nemotron 3.5 Lightning,同日在 GitHub 开源模型路由库 NeMo Switchyard。前者是 30B 总参数、3B 激活参数的混合式 MoE 模型,把 Mamba-2 层与 MoE 层交错排列,另加少量 Attention 层,并搭配推测解码与量化,提供 NVFP4 与 BF16 两种检查点。权重可在 Hugging Face 与 ModelScope 下载,另可通过 OpenRouter 与 build.nvidia.com 的 NIM 微服务直接调用,企业免费使用与修改,无需另行取得许可或付费。同场还释出 Nemotron-RL-Agentic-Terminal-Pivot 后训练数据集。
官方自报数字与可运行的硬件
NVIDIA 官方自报三项数字:输出速度最高达同级模型的 4 倍、代理任务完成速度快 30%、在 PinchBench 上达到同级前沿准确度。三项均为厂商自报,第三方尚未复现。硬件门槛才是重点:单张 GPU 的 RTX PC、DGX Spark、DGX Station、Jetson 设备与 RTX PRO 工作站都跑得动,往上可延伸到数据中心与云端。NVIDIA 定位为长时间运行代理工作负载的高效率同级模型,用途举例包括代码审查、工具调用、安全告警监看与账务问答。
Switchyard 要解的是 “混用多模型”
Switchyard 是一套路由库,让同时接入多个模型的系统把每个请求导向最合适的那一个,应用程序本身不必重写。NVIDIA 内部基准宣称,在维持前沿准确度的同时,可把任务完成成本压到单独使用 Opus 4.8 的约三分之一。这个数字有两层要留意:
- 一是厂商自报、第三方尚未复现。
- 二是对照组直接采用竞争对手的模型,本就对发布方有利。
目前 Switchyard 只在 GitHub 上,伙伴平台稍后上线。
对管理者的意义
值得注意的不是又多一个模型,而是 “小模型跑在自己机器上” 变得更务实:数据不出境、成本可预期。在泰国的台商与中小企业,与其等一个万能大脑,不如先在流程里挑一件重复又麻烦的事,例如每天核对出货单、监看安全告警,交给这种专职小工当固定岗位。