專欄 AI 管理編年史 第 251/303 講 查看課程目錄

Gemini 3.5 Transcribe 公開預覽:串流字錯率 4.0%,Google 自稱最精準語音轉文字模型

28/08/2026 218
4:29
Gemini 3.5 Transcribe 公開預覽:串流字錯率 4.0%,Google 自稱最精準語音轉文字模型
圖/Photo by Franck V. on Unsplash

Google DeepMind 於 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 公開預覽,第三方機構 Artificial Analysis 量測的串流字錯率 4.0%、非串流 2.6%,最終逐字稿產出時間較前代 Chirp 3 改善七成,支援 85 種以上語言,並可自動清除贅詞、自動格式化。

Google DeepMind 於 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 的公開預覽,官方將它定位為「最精準的語音轉文字模型」。這不是預告,而是已經出貨、開發者當天就能呼叫的版本。

兩組數字:串流 4.0%、非串流 2.6%

由第三方機構 Artificial Analysis 量測的字錯率(WER)分兩種模式:即時串流為 4.0%,允許先收完整段音訊再處理的非串流模式為 2.6%。在跨語言公開基準 FLEURS 上,兩種模式分別為 5.50% 與 5.04%。FLEURS 為跨語言公開語料,涵蓋語種更廣、口音更雜,數字自然高於前一組平均值;兩者屬不同評測來源,不宜當成「內部對公開」的對照。值得注意的是,兩種模式的差距在 FLEURS 上明顯縮小。

功能面則一次補齊了過去得靠後製才有的東西:

  • 支援 85 種以上語言,且能自動偵測語種
  • 針對預錄音檔可標時間戳並辨識最多 3 位語者(speaker diarization),3 人以上為實驗性支援
  • 可掛自訂詞彙,讓專有名詞、品牌名、料號不再被拼錯
  • 自動清理口吃與「嗯、那個」這類贅詞
  • 自動格式化輸出,直接產生可讀段落而非一長串文字
  • 可與其他 Gemini 模型做 function calling,轉錄完直接接後續動作

真正的變化是速度,不只是準度

相較前代 Chirp 3(2025 年),Gemini 3.5 Transcribe 產出最終逐字稿的時間(time to final transcription)改善約 70%。準度每年都在進步,但這一段時間縮掉七成,才是把「語音」從事後檔案變成即時介面的關鍵:邊開會邊出紀錄、客服通話進行中就跳出摘要,這類情境的門檻取決於多快拿得到可用文字,而不是小數點後的字錯率。

上線範圍:企業端與消費端同步鋪開

開發端可在 Gemini API(Google AI Studio)、Google Antigravity 與 Gemini Enterprise Agent Platform 取用,Gemini Enterprise for Customer Experience 標示為即將跟進——把語音轉錄直接放進客服平台的意圖相當明顯。消費端則已進入 macOS 版 Gemini app 與 Android Gboard 的 Rambler 功能,Chrome 標示即將支援。要留意的是,macOS 版目前為英文介面,Rambler 也僅先開放部分國家與語言。官方尚未公布定價。

對管理者的意義

會議紀錄、客服通話、現場訪談這些語音資料的價值,過去卡在整理成本上——請人聽打或請人潤稿,貴到只能挑重要的做。這次真正被壓縮的不是「辨識」,而是「逐字稿到可用紀錄」那一段人力:贅詞自動清、段落自動分,產出已接近可歸檔的版本。若要試,先挑一場本來就有人工紀錄的會議做對照,比對 AI 版漏了什麼,再決定流程要怎麼改。同時有兩個限制要先看清楚:公開預覽階段沒有定價,成本無法納入預算;語者辨識穩定支援到 3 人、再多屬實驗性,且該能力是針對預錄音檔而非即時串流,正式使用前需自行驗證。企業導入前也務必確認錄音資料的落地與保存規範。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Google 發布 Gemini Omni 1.1 Flash:影片生成新增場景延伸、首尾影格、360p 草稿與 4K 輸出

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策