专栏 AI 管理编年史 第 247/303 讲 查看课程目录

NVIDIA Groq 3 LPX 全面量产:每秒 3,400 token 的实时吐字,代理式 AI 的等待被改写

28/08/2026 134
3:50
NVIDIA Groq 3 LPX 全面量产:每秒 3,400 token 的实时吐字,代理式 AI 的等待被改写
图/Photo by Kier in Sight Archives on Unsplash

2026 年 8 月 24 日,NVIDIA 在 Hot Chips 2026 宣布交互式 AI 推理加速器 Groq 3 LPX 进入全面量产。官方在 10 万 token 长上下文场景下实测达每秒 3,400 个输出 token,每机柜搭载 256 颗 LPX,宣称比最接近的替代平台快约 4 倍。Nebius 为首家采用的 AI 云厂商,本次未公布定价。

2026 年 8 月 24 日,NVIDIA 在 Hot Chips 2026 上宣布,交互式 AI 推理加速器 Groq 3 LPX 进入 full production 全面量产。它的定位不在训练,而在推理的吐字速度——把答案一个字一个字送出来的快慢。对天天在等 AI 回话的人来说,这比参数量更贴身。

官方公布了哪些数字

本次公告披露的关键规格与实测条件如下:

  • 在 100,000 token 的长上下文场景下实测,输出速度达每秒 3,400 个 token。
  • 每个机柜搭载 256 颗 LPX 加速器。
  • 官方宣称,相比最接近的替代平台,响应速度约有 4 倍优势。
  • 定位为延伸 Vera Rubin 平台的推理性能,与 BlueField-4 DPU、Vera CPU 机柜、Spectrum-6 SPX 以太网整合。

需要特别标注的一点是:本次公告完全没有披露定价。因此任何“每 token 成本会降多少”的说法,目前都还没有官方依据。

技术意义:瓶颈从“算不算得完”变成“等不等得起”

过去两年的算力竞赛,讲的多半是训练规模。但企业真正把 AI 放进日常工作流之后,痛点换了一个:代理式 AI(agentic AI)不是问一句答一句,而是自己读资料、自己调用工具、自己反复修正,一个任务背后可能是几十次往返。单次延迟乘上几十倍,就成了用户盯着光标闪烁的空白。

10 万 token 的长上下文也不是随便挑的测试条件——那正是“把整份合同、整个代码库丢进去让 AI 自己读”的实际用法。NVIDIA 举的例子是:原本需要数小时的编码任务,有望缩短到数分钟。

谁先用,以及这条产品线的来历

首批采用者已经点名:Nebius 是第一家采用的 AI 云厂商,将在 2026 年底前把 Groq 3 LPX 导入自家的 Nebius Token Factory 生产平台;Groq 公司本身也是最早采用者之一。这条产品线源自 NVIDIA 与 Groq Inc. 于 2025 年底签署的大型授权协议,距这次量产公告约八个月,以半导体行业的节奏来看相当紧凑。黄仁勋的说法是,Vera Rubin 以工作负载优化的 AI 工厂配置,正在延伸至代理式 AI 时代。

对管理者的意义

先把期待放在对的位置:这则新闻确定的是速度,不确定的是成本。定价未公布,实际账单要等云服务方案上线才看得到,现在调整预算为时过早。但有一件事现在就能做——盘点你的流程里,哪些等待时间其实是真的在烧钱,例如工程师等编译与等 AI 的叠加。当这些等待从小时级掉到分钟级,改变的不只是效率数字,而是谁该在什么时候做决定的节奏。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 OpenAI 自研推理芯片 Jalapeño 首批基准结果公开:端到端快 1.7–3.6 倍,2027 年才放量

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策