NVIDIA Groq 3 LPX 全面量产:每秒 3,400 token 的实时吐字,代理式 AI 的等待被改写
2026 年 8 月 24 日,NVIDIA 在 Hot Chips 2026 宣布交互式 AI 推理加速器 Groq 3 LPX 进入全面量产。官方在 10 万 token 长上下文场景下实测达每秒 3,400 个输出 token,每机柜搭载 256 颗 LPX,宣称比最接近的替代平台快约 4 倍。Nebius 为首家采用的 AI 云厂商,本次未公布定价。
2026 年 8 月 24 日,NVIDIA 在 Hot Chips 2026 上宣布,交互式 AI 推理加速器 Groq 3 LPX 进入 full production 全面量产。它的定位不在训练,而在推理的吐字速度——把答案一个字一个字送出来的快慢。对天天在等 AI 回话的人来说,这比参数量更贴身。
官方公布了哪些数字
本次公告披露的关键规格与实测条件如下:
- 在 100,000 token 的长上下文场景下实测,输出速度达每秒 3,400 个 token。
- 每个机柜搭载 256 颗 LPX 加速器。
- 官方宣称,相比最接近的替代平台,响应速度约有 4 倍优势。
- 定位为延伸 Vera Rubin 平台的推理性能,与 BlueField-4 DPU、Vera CPU 机柜、Spectrum-6 SPX 以太网整合。
需要特别标注的一点是:本次公告完全没有披露定价。因此任何“每 token 成本会降多少”的说法,目前都还没有官方依据。
技术意义:瓶颈从“算不算得完”变成“等不等得起”
过去两年的算力竞赛,讲的多半是训练规模。但企业真正把 AI 放进日常工作流之后,痛点换了一个:代理式 AI(agentic AI)不是问一句答一句,而是自己读资料、自己调用工具、自己反复修正,一个任务背后可能是几十次往返。单次延迟乘上几十倍,就成了用户盯着光标闪烁的空白。
10 万 token 的长上下文也不是随便挑的测试条件——那正是“把整份合同、整个代码库丢进去让 AI 自己读”的实际用法。NVIDIA 举的例子是:原本需要数小时的编码任务,有望缩短到数分钟。
谁先用,以及这条产品线的来历
首批采用者已经点名:Nebius 是第一家采用的 AI 云厂商,将在 2026 年底前把 Groq 3 LPX 导入自家的 Nebius Token Factory 生产平台;Groq 公司本身也是最早采用者之一。这条产品线源自 NVIDIA 与 Groq Inc. 于 2025 年底签署的大型授权协议,距这次量产公告约八个月,以半导体行业的节奏来看相当紧凑。黄仁勋的说法是,Vera Rubin 以工作负载优化的 AI 工厂配置,正在延伸至代理式 AI 时代。
对管理者的意义
先把期待放在对的位置:这则新闻确定的是速度,不确定的是成本。定价未公布,实际账单要等云服务方案上线才看得到,现在调整预算为时过早。但有一件事现在就能做——盘点你的流程里,哪些等待时间其实是真的在烧钱,例如工程师等编译与等 AI 的叠加。当这些等待从小时级掉到分钟级,改变的不只是效率数字,而是谁该在什么时候做决定的节奏。