专栏 AI 管理编年史 第 251/303 讲 查看课程目录

Gemini 3.5 Transcribe 公开预览:流式字错率 4.0%,谷歌自称最精准语音转文字模型

28/08/2026 219
4:29
Gemini 3.5 Transcribe 公开预览:流式字错率 4.0%,谷歌自称最精准语音转文字模型
图/Photo by Franck V. on Unsplash

谷歌 DeepMind 于 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 公开预览,第三方机构 Artificial Analysis 测得的流式字错率 4.0%、非流式 2.6%,最终逐字稿产出时间较上一代 Chirp 3 改善七成,支持 85 种以上语言,并会自动清除口头禅、自动排版。

谷歌 DeepMind 于 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 的公开预览,官方将其定位为「最精准的语音转文字模型」。这不是预告,而是已经交付、开发者当天就能调用的版本。

两组数字:流式 4.0%、非流式 2.6%

由第三方机构 Artificial Analysis 测得的字错率(WER)分两种模式:实时流式为 4.0%,允许先收完整段音频再处理的非流式模式为 2.6%。在跨语言公开基准 FLEURS 上,两种模式分别为 5.50% 与 5.04%。FLEURS 是跨语言公开语料,覆盖语种更广、口音更杂,数字自然高于前一组均值;两者属于不同评测来源,不宜当作「内部对公开」的对照。值得注意的是,两种模式的差距在 FLEURS 上明显缩小。

功能层面则一次补齐了过去要靠后期处理才有的能力:

  • 支持 85 种以上语言,并能自动检测语种
  • 针对预录音频可标时间戳并识别最多 3 位说话人(speaker diarization),3 人以上为实验性支持
  • 可挂载自定义词表,让专有名词、品牌名、物料编码不再被写错
  • 自动清理结巴与「嗯、那个」这类口头禅
  • 自动排版输出,直接生成可读段落,而不是一长串文字
  • 可与其他 Gemini 模型做 function calling,转写完直接衔接后续动作

真正的变化是速度,而不只是准确度

相比上一代 Chirp 3(2025 年),Gemini 3.5 Transcribe 产出最终逐字稿的时间(time to final transcription)改善约 70%。准确度每年都在进步,但这一段时间砍掉七成,才是把「语音」从事后文件变成实时界面的关键:边开会边出纪要、客服通话进行中就弹出摘要,这类场景的门槛取决于多快拿到可用文字,而不是小数点后的字错率。

上线范围:企业端与消费端同步铺开

开发端可在 Gemini API(Google AI Studio)、Google Antigravity 与 Gemini Enterprise Agent Platform 使用,Gemini Enterprise for Customer Experience 标注为即将跟进——把语音转写直接放进客服平台的意图相当明显。消费端已进入 macOS 版 Gemini app 与安卓 Gboard 的 Rambler 功能,Chrome 标注即将支持。需要留意的是,macOS 版目前为英文界面,Rambler 也仅先开放部分国家与语言。官方尚未公布定价。

对管理者的意义

会议纪要、客服通话、现场访谈这些语音数据的价值,过去卡在整理成本上——请人听打或请人润色,贵到只能挑重要的做。这次真正被压缩的不是「识别」,而是「逐字稿到可用纪要」那一段人力:口头禅自动清、段落自动分,产出已接近可归档的版本。若要试,先挑一场本来就有人工纪要的会议做对照,比对 AI 版漏了什么,再决定流程怎么改。同时有两个限制要先看清楚:公开预览阶段没有定价,成本无法纳入预算;说话人识别稳定支持到 3 人、再多属实验性,且该能力针对的是预录音频而非实时流式,正式使用前需自行验证。企业落地前也务必确认录音数据的存放与留存规范。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Google 发布 Gemini Omni 1.1 Flash:视频生成新增场景延伸、首尾帧、360p 草稿与 4K 输出

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策