Gemini 3.5 Transcribe 公開預覽:串流字錯率 4.0%,Google 自稱最精準語音轉文字模型
Google DeepMind 於 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 公開預覽,第三方機構 Artificial Analysis 量測的串流字錯率 4.0%、非串流 2.6%,最終逐字稿產出時間較前代 Chirp 3 改善七成,支援 85 種以上語言,並可自動清除贅詞、自動格式化。
Google DeepMind 於 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 的公開預覽,官方將它定位為「最精準的語音轉文字模型」。這不是預告,而是已經出貨、開發者當天就能呼叫的版本。
兩組數字:串流 4.0%、非串流 2.6%
由第三方機構 Artificial Analysis 量測的字錯率(WER)分兩種模式:即時串流為 4.0%,允許先收完整段音訊再處理的非串流模式為 2.6%。在跨語言公開基準 FLEURS 上,兩種模式分別為 5.50% 與 5.04%。FLEURS 為跨語言公開語料,涵蓋語種更廣、口音更雜,數字自然高於前一組平均值;兩者屬不同評測來源,不宜當成「內部對公開」的對照。值得注意的是,兩種模式的差距在 FLEURS 上明顯縮小。
功能面則一次補齊了過去得靠後製才有的東西:
- 支援 85 種以上語言,且能自動偵測語種
- 針對預錄音檔可標時間戳並辨識最多 3 位語者(speaker diarization),3 人以上為實驗性支援
- 可掛自訂詞彙,讓專有名詞、品牌名、料號不再被拼錯
- 自動清理口吃與「嗯、那個」這類贅詞
- 自動格式化輸出,直接產生可讀段落而非一長串文字
- 可與其他 Gemini 模型做 function calling,轉錄完直接接後續動作
真正的變化是速度,不只是準度
相較前代 Chirp 3(2025 年),Gemini 3.5 Transcribe 產出最終逐字稿的時間(time to final transcription)改善約 70%。準度每年都在進步,但這一段時間縮掉七成,才是把「語音」從事後檔案變成即時介面的關鍵:邊開會邊出紀錄、客服通話進行中就跳出摘要,這類情境的門檻取決於多快拿得到可用文字,而不是小數點後的字錯率。
上線範圍:企業端與消費端同步鋪開
開發端可在 Gemini API(Google AI Studio)、Google Antigravity 與 Gemini Enterprise Agent Platform 取用,Gemini Enterprise for Customer Experience 標示為即將跟進——把語音轉錄直接放進客服平台的意圖相當明顯。消費端則已進入 macOS 版 Gemini app 與 Android Gboard 的 Rambler 功能,Chrome 標示即將支援。要留意的是,macOS 版目前為英文介面,Rambler 也僅先開放部分國家與語言。官方尚未公布定價。
對管理者的意義
會議紀錄、客服通話、現場訪談這些語音資料的價值,過去卡在整理成本上——請人聽打或請人潤稿,貴到只能挑重要的做。這次真正被壓縮的不是「辨識」,而是「逐字稿到可用紀錄」那一段人力:贅詞自動清、段落自動分,產出已接近可歸檔的版本。若要試,先挑一場本來就有人工紀錄的會議做對照,比對 AI 版漏了什麼,再決定流程要怎麼改。同時有兩個限制要先看清楚:公開預覽階段沒有定價,成本無法納入預算;語者辨識穩定支援到 3 人、再多屬實驗性,且該能力是針對預錄音檔而非即時串流,正式使用前需自行驗證。企業導入前也務必確認錄音資料的落地與保存規範。