專欄 AI 管理編年史 第 215/217 講 查看課程目錄

SpaceXAI(原 xAI)發表 Grok Voice Think Fast 2.0:首音延遲砍半、推理 token 省六成

03/08/2026 271
4:33
SpaceXAI(原 xAI)發表 Grok Voice Think Fast 2.0:首音延遲砍半、推理 token 省六成

SpaceXAI(原 xAI)於 2026-07-29 推出語音對語音模型 grok-voice-think-fast-2.0,首音時間自 1.25 秒降至 0.70 秒,第三方榜單總分 82.9%,並同步上架 Agent Builder。8 月 5 日起 API 別名將自動改指向新版。

SpaceXAI(原 xAI,2026 年 7 月遭 SpaceX 併購後更名)於 2026 年 7 月 29 日發表新一代語音對語音(speech-to-speech)模型 grok-voice-think-fast-2.0,並同步上架 Agent Builder,定價為每音訊分鐘 0.08 美元。最直接的規格變化是「開口的速度」:首音時間(time to first audio)自前代的 1.25 秒降至 0.70 秒,幾乎砍半。這 0.55 秒決定了對話聽起來像「在講話」,還是像「在等機器想」。

哪些是第三方、哪些是自報

解讀這次發表,必須先把數據來源分清楚,否則容易高估。

  • 第三方榜單(Artificial Analysis speech-to-speech):總分 82.9%,前代 Think Fast 1.0 為 75.7%;agentic 分項 56.5%(前代 52.1%);對話分項 95.1%。
  • SpaceXAI 官方自報(準確度):轉錄準確度在 24 種語言、數千條短語上,較 Deepgram Nova 3 與 ElevenLabs Scribe v2 提升 1.5 至 2.0 倍,較自家前代提升 1.4 倍;吵雜環境下差距拉開至約 10 倍。
  • SpaceXAI 官方自報(效率):推理 token 的中位使用量降至前代的 0.4 倍,約省六成。

換句話說,總分 82.9% 有第三方背書,「準確度高 10 倍」則是官方自訂條件下得出的結果,兩者不該被寫成同一種可信度。

技術意義:邊想邊說

低延遲與高品質在語音模型上長期互斥——想得越多,開口越慢。這一代的做法是讓推理與發話平行進行:模型一邊說,一邊繼續思考後續內容,而不是想完才開口。搭配推理 token 中位使用量降至 0.4 倍,實際效果不只是「聽起來順」,更關鍵的是工具調用(tool use)反應變快——語音助理要查訂單、改預約、送出工單時,中間的空白會明顯縮短。agentic 分項從 52.1% 升到 56.5%,正對應這個方向;但 56.5% 這個絕對值也誠實說明了,語音代理人自動完成多步驟任務,離「放著不管」還有距離。

版本切換:8 月 5 日自動升級

對開發者最需要注意的是排程。API 別名 grok-voice-latest 自 2026 年 8 月 5 日起自動改指向本模型。

  • 想用新版:什麼都不必做,屆時自動升級。
  • 想留在舊版:必須手動釘選 grok-voice-think-fast-1.0

這種「預設升級」對多數團隊是便利,但對已針對舊版調校過語氣、逐字稿後處理或延遲預期的產品,可能在當天出現非預期的行為變化。

對管理者的意義

從 Grok Voice 於 2026 年 6 月首度公開上線,到 GPT-Live 世代、Anthropic 語音模式相繼推出,語音介面在兩個月內從展示品變成可比較規格的商品。對大量使用電話與口說的行業——客服、門市、餐飲訂位、飯店櫃檯——真正該追蹤的不再是「AI 會不會說話」,而是三個可量化的指標:

  • 首音延遲
  • 吵雜環境下的轉錄準確度
  • 工具調用的成功率

若貴公司正在評估語音客服,不妨拿自家最吵的那個現場(廚房、賣場、工地)錄一段真實對話去測,而不是在安靜辦公室裡聽 demo——廠商自報的「吵雜環境 10 倍」,值得你用自己的噪音驗證一次。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Gemini Robotics 2 登場:Google DeepMind 讓人形機器人有了「全身智能」

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策