专栏 AI 管理编年史 第 255/303 讲 查看课程目录

Meta 发布 Muse Voice Transcribe:单一模型实时识别、区分 20 人以上说话、每小时 0.18 美元

01/09/2026 243
3:53
Meta 发布 Muse Voice Transcribe:单一模型实时识别、区分 20 人以上说话、每小时 0.18 美元
图/Photo by Kevin Gonzalez on Unsplash

Meta Superintelligence Labs 9 月 1 日推出首款实时音频感知模型 Muse Voice Transcribe,单一模型完成流式语音识别、20 人以上说话人分离与语句端点检测,支持同句跨语言混说,流式 WER 3.1%,API 定价每 1,000 音频分钟 3 美元。

Meta 于 2026 年 9 月 1 日(太平洋时间上午 10 点)在 research.meta.ai 发布 Muse Voice Transcribe,这是 Meta Superintelligence Labs 首款“实时音频感知”模型,隶属 Muse Spark 家族。它采用自回归多模态架构,把音频每 80 毫秒切成一块转为 soft token 输入模型,因此能边听边输出文字,不必等整段录音结束再处理。

官方公布的核心规格如下:

  • 单一模型原生完成三件事:流式语音识别、20 人以上的说话人分离(谁在说话)、语句端点检测,不需另接后处理流水线。
  • 训练覆盖 70 种以上语言,其中 25 种经完整验证,包含中文、日文、越南文、西班牙文;支持同一句话里跨语言 code-switching。
  • 可用语言、关键词或场景“偏置”提示,提升人名、产品名等专有名词识别率。
  • 自适应延迟:依字词难度决定何时输出结果,简单词先出、难词多等一点。
  • 原生支持超过一小时的连续录音。

官方数据为流式词错率(WER)3.1%,说话人分离错误率 17.5%(以 AMI-IHM、AMI-SDM、VoxConverse 三个基准计),并在发布当日登上 Artificial Analysis 流式语音识别榜与公开分离基准榜首。

技术意义:三条流水线合成一条

过去的会议逐字稿多是“识别模型+分离模型+断句规则”三段拼接,各段延迟与错误互相叠加。Muse Voice Transcribe 把三项任务放进同一个自回归模型,延迟可控、上下文共享——模型知道上一句是谁说的,断句与分离能互相参考。80 毫秒切块加自适应延迟,则是在“实时”与“准确”之间折中的具体做法。

与竞品比较与获取方式

Meta Model API 定价为每 1,000 音频分钟 3 美元(约每小时 0.18 美元),且已含说话人分离;多数同类服务定价高于此,分离功能也常需另计,此价位属市场低价区间。即日起三个入口可用:Meta Model API、Muse Code,以及 Meta AI for Mac(按 Fn 键即可语音听写)。Meta 同时声明音频不永久存储,逐字稿会标注“AI 生成,可能有误”。

对管理者的意义

在泰国的台/中/泰三语团队,会议常是中文、泰文、英文混说,人工整理纪要慢又易漏。这款模型的跨语言混说与自动区分发言人,加上每小时约 6 泰铢(依汇率换算)的成本,值得评估替代人工会议记录。但泰文不在 25 种完整验证语言之列,正式导入前应先用真实会议录音实测泰文段落准确率,再决定是否全面采用。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。

大家怎么说 · 3 条留言

晓
晓明
我们现在就考虑上这个替代会议记录,但泰文准确率是个问题。文章说泰文还没完整验证,有人实测过吗,真实场景里泰文识别到底咋样?
10/09/2026 20:10
周
周末加班狗食安主任
太对了,我们店里交接会纪要还是人工整理,既慢又容易露。
06/09/2026 11:11
晓
晓丹
工地五六人讲还有噪音,根本没法整里啊。
08/09/2026 19:31
下一讲・AI 管理编年史 Gemini 3.8 Flash 与 Flash Cyber 发布:三周内第三款 Flash,入门价撑到年底

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策