Gemini 3.8 Flash TTS 正式 GA:用一段文字描述就生成音色,语音成本砍到前代一半以下
谷歌在 2026-09-22 的 Gemini API changelog 宣布,Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音模型正式 GA,取代 Gemini 3.1 Flash TTS Preview。新版主打录音棚级音质与「语音设计」:用一段文字描述想要的声音特质即可生成音色。音频输出从每百万 token 20 美元降到 9 美元,降幅过半。
谷歌于 2026 年 9 月 22 日在 Gemini API 官方 changelog 宣布,Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型正式进入 GA(generally available,普通开发者均可用于生产环境),取代此前的 Gemini 3.1 Flash TTS Preview。第三方技术媒体多把这条消息记为 9 月 23 日,实际官方版本记录的日期是 9 月 22 日。
规格与价格:两条产品线的分工
这次 GA 把语音产品线一分为二,让开发者按语言需求与预算选择:
- Flash TTS:支持完整语言清单,音频费率较高,适合多语市场。
- Flash-Lite TTS:语言清单较短,费率较低,适合单一语言、大批量的场景。
Flash TTS 的标准费率为文本输入每百万 token 0.50 美元、音频输出每百万 token 9.00 美元;官方注明这是 2026 年底前的优惠价,2027 年 1 月 1 日起将调整为 1.00 与 18.00 美元。音频按每秒 25 token 计费,折算下来每生成一秒语音约 0.02 美分。
技术意义:选音色变成描述音色
官方强调两项能力。一是 studio-grade(录音棚级)的音质保真度;二是 voice design(语音设计)——除了从既有的固定音色清单挑选,用户也可以用一段文字描述想要的声音特质,由模型直接生成对应音色。此外也支持从短样本复制声音,并附带同意声明的核验机制。
这个转变值得注意:过去语音合成的个性化,受限于供应商预先录好的音色库;现在音色本身变成可被自然语言指定的参数。对需要保持品牌一致语调的组织来说,这是在「挑最接近的」之外,多出一条「说清楚要什么」的路。
与前代比较:降价过半的信号
它所取代的 Gemini 3.1 Flash TTS Preview,音频输出费率是每百万 token 20.00 美元。新版 9.00 美元相当于降价过半,而且是在从 Preview 升级为 GA、可用于生产环境的同时发生。价格与稳定度同时往有利方向走,通常意味着供应商对底层推理成本已有把握,也意味着语音功能正从实验性增值项,变成可以写进正式产品规格的基础组件。
对管理者的意义
当每秒语音的边际成本降到 0.02 美分,过去因为录音与配音成本而被否决的内部提案,值得重新拿出来算一遍:多语客服语音、产品操作导览、培训旁白、门店广播。但别忽略两件事——2027 年 1 月 1 日起费率会上调为现行优惠价的两倍,长期预算要用调整后的数字估算;声音复制的同意声明机制,在泰国 PDPA 框架下同样是必须留存的凭证,不是技术细节而是合规记录。