SpaceXAI(原 xAI)发布 Grok Voice Think Fast 2.0:首音延迟砍半、推理 token 省六成
SpaceXAI(原 xAI)于 2026-07-29 推出语音对语音模型 grok-voice-think-fast-2.0,首音时间从 1.25 秒降至 0.70 秒,第三方榜单总分 82.9%,并同步上线 Agent Builder。8 月 5 日起 API 别名将自动指向新版。
SpaceXAI(原 xAI,2026 年 7 月被 SpaceX 并购后更名)于 2026 年 7 月 29 日发布新一代语音对语音(speech-to-speech)模型 grok-voice-think-fast-2.0,并同步上线 Agent Builder,定价为每音频分钟 0.08 美元。最直接的规格变化是「开口的速度」:首音时间(time to first audio)从上一代的 1.25 秒降至 0.70 秒,几乎砍半。这 0.55 秒决定了对话听起来像「在讲话」,还是像「在等机器想」。
哪些是第三方、哪些是厂商自报
解读这次发布,必须先把数据来源分清楚,否则容易高估。
- 第三方榜单(Artificial Analysis speech-to-speech):总分 82.9%,上一代 Think Fast 1.0 为 75.7%;agentic 分项 56.5%(上一代 52.1%);对话分项 95.1%。
- SpaceXAI 官方自报(准确度):转录准确度在 24 种语言、数千条短语上,较 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5 至 2.0 倍,较自家上一代提升 1.4 倍;嘈杂环境下差距拉大到约 10 倍。
- SpaceXAI 官方自报(效率):推理 token 的中位使用量降至上一代的 0.4 倍,约省六成。
换句话说,总分 82.9% 有第三方背书,「准确度高 10 倍」则是官方自定条件下得出的结果,两者不该被写成同一种可信度。
技术意义:边想边说
低延迟与高质量在语音模型上长期互斥——想得越多,开口越慢。这一代的做法是让推理与发声并行进行:模型一边说,一边继续思考后续内容,而不是想完才开口。配合推理 token 中位使用量降至 0.4 倍,实际效果不只是「听起来顺」,更关键的是工具调用(tool use)响应变快——语音助理要查订单、改预约、提交工单时,中间的空白会明显缩短。agentic 分项从 52.1% 升到 56.5%,正对应这个方向;但 56.5% 这个绝对值也诚实说明了,语音智能体自动完成多步骤任务,离「放着不管」还有距离。
版本切换:8 月 5 日自动升级
对开发者最需要注意的是排期。API 别名 grok-voice-latest 自 2026 年 8 月 5 日起自动指向本模型。
- 想用新版:什么都不必做,届时自动升级。
- 想留在旧版:必须手动固定
grok-voice-think-fast-1.0。
这种「默认升级」对多数团队是便利,但对已针对旧版调校过语气、逐字稿后处理或延迟预期的产品,可能在当天出现非预期的行为变化。
对管理者的意义
从 Grok Voice 于 2026 年 6 月首度公开上线,到 GPT-Live 世代、Anthropic 语音模式相继推出,语音界面在两个月内从展示品变成可比较规格的商品。对大量使用电话与口语的行业——客服、门店、餐饮订位、酒店前台——真正该跟踪的不再是「AI 会不会说话」,而是三个可量化的指标:
- 首音延迟
- 嘈杂环境下的转录准确度
- 工具调用的成功率
若贵公司正在评估语音客服,不妨拿自家最吵的那个现场(厨房、卖场、工地)录一段真实对话去测,而不是在安静办公室里听 demo——厂商自报的「嘈杂环境 10 倍」,值得你用自己的噪声验证一次。