Google DeepMind 正式發布 Gemini 3.8 Live:Extended Thinking 登頂語音基準、基礎版價格僅對手七分之一
2026 年 9 月 15 日,Google DeepMind 正式發布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩個 audio-to-audio 即時語音模型,支援 97 種語言自動切換、背景工具呼叫與視覺輸入。Extended Thinking 在 Speech-to-Speech Index 以 82.6 超越 OpenAI 與 xAI;基礎版 3.8 Live 每小時語音成本 0.84 美元,約為 GPT-Live-1 Astra 的七分之一。
2026 年 9 月 15 日,Google DeepMind 宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 正式上線(GA),model id 分別為 gemini-3.8-live 與 gemini-3.8-live-extended-thinking。兩者都是 audio-to-audio 即時語音模型:3.8 Live 定位為低延遲、視覺接地、成本導向的預設語音代理;Extended Thinking 則能在對話進行中於背景推理,處理高複雜度任務。這是 Live API 首次由 3.8 世代驅動,距離 OpenAI 在 9 月 10 日把 GPT-Live-1 推進 API 僅隔五天。
兩個模型的共同能力有三項:
- 對話中自動偵測並切換 97 種語言,不需事先指定。
- 工具與 API 呼叫在背景執行,對話不會中斷。
- 近即時處理視覺輸入,可邊看邊說。
基準成績:Extended Thinking 排名第一
依 Artificial Analysis 等第三方基準,Gemini 3.8 Live Extended Thinking 在 Speech-to-Speech Index 拿下 82.6,超過 OpenAI GPT-Live-1 Astra 的 81.5 與 xAI Grok Voice Think Fast 2.0 的 81.3。在代理任務 τ-Voice 得分 68.6%,領先 GPT-Live-1 的 67.9% 與 Grok 的 56.5%;τ³-Banking 為 35.1%,高於 GPT-Live-1 的 32.0%。另外,Gemini 3.8 Live 系列在 Big Bench Audio 上達 97.7%。差距不算懸殊,但三家中排名第一的位置目前確實由 Google 拿下。
價格戰:基礎版成本降到對手的七分之一
真正拉開距離的是定價。以每小時輸入音訊換算,3.8 Live 為 0.84 美元、Extended Thinking 為 3.50 美元;相較之下 Grok Voice Think Fast 2.0 為 4.80 美元、GPT-Live-1 Astra 為 5.83 美元。換言之,基礎版 3.8 Live 的成本約為 GPT-Live-1 Astra 的七分之一;登頂基準的 Extended Thinking 雖然貴一些,仍約為 OpenAI 的六成、也低於 xAI。這意味語音客服、語音助理這類需要長時間通話的場景,成本結構將被重新計算。
通路:從 API 到 Workspace 同步鋪開
開發者即日可在 Gemini API 與 Google AI Studio 使用;一般用戶透過 Search Live、Gemini Live app 以及 Google Workspace 的 Docs、Gmail、Keep 接觸到新模型;企業版 Gemini Enterprise 進入私人預覽,後續納入 Gemini Enterprise for Customer Experience。與 OpenAI 相比,Google 的優勢在於既有的 Workspace 與搜尋入口,讓語音模型不只是 API,而是直接嵌進日常工具。
對管理者的意義
語音代理的成本門檻在一週內被大幅壓低,且 97 種語言自動切換對泰國這種台、中、泰、英混用的職場特別有用。若你的門市、客服或訂房線上正評估語音 AI,這則新聞代表選擇變多、價格下探,可以先用 AI Studio 以 3.8 Live 試接一條最常見的客服對話,觀察延遲與語言切換是否符合實際場景,再決定是否投入。