NVIDIA 釋出開放模型 Nemotron 3.5 Lightning、同日開源 NeMo Switchyard
NVIDIA 於 2026-08-11 發表 30B/3B active 的開放模型 Nemotron 3.5 Lightning,並同日在 GitHub 開源模型路由函式庫 NeMo Switchyard。本文拆解規格與硬體門檻,並標明哪些效能與成本數字屬於廠商自報、第三方尚未複現。
NVIDIA 於 2026 年 8 月 11 日在官方部落格發表開放模型 Nemotron 3.5 Lightning,同日在 GitHub 開源模型路由函式庫 NeMo Switchyard。前者是 30B 總參數、3B 啟用參數的混合式 MoE 模型,把 Mamba-2 層與 MoE 層交錯排列,另加少量 Attention 層,並搭配推測解碼與量化,提供 NVFP4 與 BF16 兩種檢查點。權重可於 Hugging Face 與 ModelScope 下載,另可透過 OpenRouter 與 build.nvidia.com 的 NIM 微服務直接取用,企業免費使用與修改,不需另外取得許可或付費。同場並釋出 Nemotron-RL-Agentic-Terminal-Pivot 後訓練資料集。
官方自報數字與可跑的硬體
NVIDIA 官方自報三項數字:輸出速度最高達同級模型的 4 倍、代理任務完成速度快 30%、在 PinchBench 上達到同級前沿準確度。三項皆為廠商自報,第三方尚未複現。硬體門檻才是重點:單張 GPU 的 RTX PC、DGX Spark、DGX Station、Jetson 裝置與 RTX PRO 工作站都跑得動,往上可延伸到資料中心與雲端。NVIDIA 定位為長時間運行代理工作負載的高效率同級模型,用途舉例包括程式碼審查、工具呼叫、資安告警監看與帳務問答。
Switchyard 要解的是「混用多模型」
Switchyard 是一套路由函式庫,讓同時接了多個模型的系統把每個請求導向最合適的那一個,應用程式本身不必重寫。NVIDIA 內部基準宣稱,在維持前沿準確度的同時,可把任務完成成本壓到單獨使用 Opus 4.8 的約三分之一。這個數字有兩層要留意:
- 一是廠商自報、第三方尚未複現。
- 二是對照組直接採用競爭對手的模型,本就對發布方有利。
目前 Switchyard 只在 GitHub 上,夥伴平台稍後上線。
對管理者的意義
值得注意的不是又多一個模型,而是「小模型跑在自己機器上」變得更務實:資料不出境、成本可預期。在泰國的台商與中小企業,與其等一個萬能大腦,不如先在流程裡挑一件重複又煩人的事,例如每天核對出貨單、監看資安告警,交給這種專職小工當固定崗位。