专栏 AI 管理编年史 第 233/303 讲 查看课程目录

英伟达发布开放模型 Nemotron 3.5 Lightning,同日开源 NeMo Switchyard

28/08/2026 174
3:06
英伟达发布开放模型 Nemotron 3.5 Lightning,同日开源 NeMo Switchyard
图/Photo by Zach M on Unsplash

NVIDIA 于 2026-08-11 发布 30B/3B 激活参数的开放模型 Nemotron 3.5 Lightning,并同日在 GitHub 开源模型路由库 NeMo Switchyard。本文梳理规格与硬件门槛,并标明哪些性能与成本数字属于厂商自报、第三方尚未复现。

NVIDIA 于 2026 年 8 月 11 日在官方博客发布开放模型 Nemotron 3.5 Lightning,同日在 GitHub 开源模型路由库 NeMo Switchyard。前者是 30B 总参数、3B 激活参数的混合式 MoE 模型,把 Mamba-2 层与 MoE 层交错排列,另加少量 Attention 层,并搭配推测解码与量化,提供 NVFP4 与 BF16 两种检查点。权重可在 Hugging Face 与 ModelScope 下载,另可通过 OpenRouter 与 build.nvidia.com 的 NIM 微服务直接调用,企业免费使用与修改,无需另行取得许可或付费。同场还释出 Nemotron-RL-Agentic-Terminal-Pivot 后训练数据集。

官方自报数字与可运行的硬件

NVIDIA 官方自报三项数字:输出速度最高达同级模型的 4 倍、代理任务完成速度快 30%、在 PinchBench 上达到同级前沿准确度。三项均为厂商自报,第三方尚未复现。硬件门槛才是重点:单张 GPU 的 RTX PC、DGX Spark、DGX Station、Jetson 设备与 RTX PRO 工作站都跑得动,往上可延伸到数据中心与云端。NVIDIA 定位为长时间运行代理工作负载的高效率同级模型,用途举例包括代码审查、工具调用、安全告警监看与账务问答。

Switchyard 要解的是 “混用多模型”

Switchyard 是一套路由库,让同时接入多个模型的系统把每个请求导向最合适的那一个,应用程序本身不必重写。NVIDIA 内部基准宣称,在维持前沿准确度的同时,可把任务完成成本压到单独使用 Opus 4.8 的约三分之一。这个数字有两层要留意:

  • 一是厂商自报、第三方尚未复现。
  • 二是对照组直接采用竞争对手的模型,本就对发布方有利。

目前 Switchyard 只在 GitHub 上,伙伴平台稍后上线。

对管理者的意义

值得注意的不是又多一个模型,而是 “小模型跑在自己机器上” 变得更务实:数据不出境、成本可预期。在泰国的台商与中小企业,与其等一个万能大脑,不如先在流程里挑一件重复又麻烦的事,例如每天核对出货单、监看安全告警,交给这种专职小工当固定岗位。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 SpaceXAI 发布 Grok 4.6:50 万上下文、没换底座、定价却分两段

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策