專欄 AI 管理編年史 第 284/303 講 查看課程目錄

Gemini 3.8 Flash TTS 正式 GA:用一段文字描述就生成音色,語音成本砍到前代一半以下

22/09/2026 114
4:10
Gemini 3.8 Flash TTS 正式 GA:用一段文字描述就生成音色,語音成本砍到前代一半以下
圖/Photo by Kit (formerly ConvertKit) on Unsplash

Google 於 2026-09-22 的 Gemini API changelog 宣布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款語音模型正式 GA,取代 Gemini 3.1 Flash TTS Preview。新版主打錄音室等級音質與「語音設計」:用一段文字描述想要的聲音特質即可生成音色。音訊輸出從每百萬 token 20 美元降到 9 美元,降幅逾半。

Google 於 2026 年 9 月 22 日在 Gemini API 官方 changelog 宣布,Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型正式進入 GA(generally available,一般開發者皆可用於正式環境),取代先前的 Gemini 3.1 Flash TTS Preview。第三方技術媒體多把這則消息記為 9 月 23 日,實際官方版本紀錄的日期是 9 月 22 日。

規格與價格:兩條產品線的分工

這次 GA 把語音產品線一分為二,讓開發者依語言需求與預算選邊:

  • Flash TTS:支援完整語言清單,音訊費率較高,適合多語市場。
  • Flash-Lite TTS:語言清單較短,費率較低,適合單一語言、量大的場景。

Flash TTS 的標準費率為文字輸入每百萬 token 0.50 美元、音訊輸出每百萬 token 9.00 美元;官方註明這是 2026 年底前的優惠價,2027 年 1 月 1 日起會調整為 1.00 與 18.00 美元。音訊以每秒 25 token 計費,換算下來每生成一秒語音約 0.02 美分。

技術意義:選音色變成描述音色

官方強調兩項能力。一是 studio-grade(錄音室等級)的音質保真度;二是 voice design(語音設計)——除了從既有的固定音色清單挑選,使用者也可以用一段文字描述想要的聲音特質,由模型直接生成對應音色。另外也支援從短樣本複製聲音,並附帶同意聲明的檢核機制。

這個轉變值得注意:過去語音合成的個性化,受限於供應商預先錄好的音色庫;現在音色本身變成可被自然語言指定的參數。對需要維持品牌一致語調的組織來說,這是從「挑最接近的」多出一條「說清楚要什麼」的路。

與前代比較:降價超過一半的訊號

它所取代的 Gemini 3.1 Flash TTS Preview,音訊輸出費率是每百萬 token 20.00 美元。新版 9.00 美元等於降價逾半,而且是在從 Preview 升級為 GA、可用於正式環境的同時發生。價格與穩定度同時往有利方向走,通常代表供應商對底層推論成本已有把握,也意味語音功能正從實驗性加值項,變成可以寫進正式產品規格的基礎元件。

對管理者的意義

當每秒語音的邊際成本降到 0.02 美分,過去因為錄音與配音成本而被否決的內部提案,值得重新拿出來算一次:多語客服語音、產品操作導覽、教育訓練旁白、門市廣播。但別忽略兩件事——2027 年 1 月 1 日起費率會調升為現行優惠價的兩倍,長期預算要用調整後的數字估;聲音複製的同意聲明機制,在泰國 PDPA 架構下同樣是必須留存的憑證,不是技術細節而是合規紀錄。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 ChatGPT 行動版語音接上 Work 代理:用說的就能起草文件、寫郵件、摘要 Slack

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策