英伟达在 IFA 2026 发布 PAIR 本地 AI 路由器与 RTX Spark PC:本地推理最高快 1.9 倍
2026 年 9 月 3 日,英伟达在 IFA 2026 联合微软及多家 OEM 伙伴发布 PAIR 本地 AI 路由器(免费开源、三平台 beta)、多项本地推理加速数据(llama.cpp 在 RTX 5090 上最高 1.9 倍),并预告 2026 年 10 月上市的 RTX Spark Windows PC。本文拆解这三件事各自的成熟度,以及它对「数据不能上云」的企业意味着什么。
2026 年 9 月 3 日,英伟达在德国柏林的 IFA 2026 展会上,与微软及多家 OEM 伙伴联合发布了一组围绕「本地 AI」的消息。这组消息包含三个成熟度完全不同的部分:现在就能下载的开源工具、已经上线的推理加速成果,以及要到十月才上市的个人电脑。分开来看,才不会误判自己当下能做什么。
PAIR:把局域网里的闲置显卡串起来
英伟达 PAIR(Personal AI Router,个人 AI 路由器)是一款免费开源工具,会自动发现局域网内兼容的电脑,再把彼此独立的推理请求,路由到当下算力有余量的那台机器上。支持的推理后端是目前个人端最普及的 Ollama 与 LM Studio;兼容设备涵盖 GeForce RTX 20 系列以后的显卡、RTX PRO 工作站、DGX Spark,以及 Apple M4 以上的设备。Windows、macOS、Linux 三平台的 beta 版本现在即可下载。
要注意 PAIR 做的是「调度」而不是「合体」——它把不同请求分派到不同机器,而不是把多台机器合成一块更大的 GPU 去跑同一个超大模型。对于办公室里散落着几台带独立显卡的电脑、却只有一两个人在用 AI 的组织,这种调度反而更贴近真实场景。
加速数据:已经上线,不是路线图
与 PAIR 一并公布的推理加速成果,是这次消息中最「现在进行时」的部分:
- llama.cpp 在 GeForce RTX 5090 上,吞吐量最高提升至 1.9 倍
- vLLM 在 RTX PRO 6000 Blackwell 上提升 1.2 倍
- 双 DGX Spark 组成的集群最高提升 1.4 倍
三项数据均在上述特定的新一代硬件上实测,官方并未公布 RTX 20、30、40 系列等旧显卡的对应幅度。相对地,RTX Spark Windows PC 属于预告性质——1 PetaFLOP 的 RTX Blackwell GPU、最高 128GB 统一内存、20 核 Grace CPU,OEM 名单包含联想 Yoga Pro 9n、Yoga 9n 2-in-1、宏碁概念机与另外六家厂商,上市时间是 2026 年 10 月,价格尚未公布。(同日英伟达另有一则收购新闻,属不同议题,此处不展开。)
伙伴应用:本地部署被做成一键
同场公布的还有几款把安装门槛压到最低的伙伴应用:Nous Research 的 Hermes Agent 在 Windows 上一键安装、OpenClaw 需要 24GB 以上显存的 RTX 显卡、Perplexity Portable Computer 先支持 RTX Linux(24GB 以上),Windows 版稍后跟上。过去本地跑智能体的最大成本不是硬件,而是环境配置与依赖包的折腾。
对管理者的意义
对在泰台商而言,「客户名单、薪资表、合同不能上云」往往不是保守,而是合规与客户要求。这则新闻的价值在于:数据留在自己办公室里跑 AI,门槛正在下降——新一代 RTX 硬件(实测机型为 RTX 5090、RTX PRO 6000 Blackwell、DGX Spark)靠软件栈更新就有明显加速,局域网调度有免费工具,应用端也开始一键化。务实的做法是先拿一台现成的 RTX 电脑,装 Ollama 或 LM Studio 试跑内部文档问答,确认质量与速度是否够用,再谈要不要采购硬件。至于 RTX Spark,记住它十月才上市、价格未公布,PAIR 也仍是 beta,这两件事都还不适合写进今年的采购决议里。