Meta 发布 Muse Voice Transcribe:单一模型实时识别、区分 20 人以上说话、每小时 0.18 美元
Meta Superintelligence Labs 9 月 1 日推出首款实时音频感知模型 Muse Voice Transcribe,单一模型完成流式语音识别、20 人以上说话人分离与语句端点检测,支持同句跨语言混说,流式 WER 3.1%,API 定价每 1,000 音频分钟 3 美元。
Meta 于 2026 年 9 月 1 日(太平洋时间上午 10 点)在 research.meta.ai 发布 Muse Voice Transcribe,这是 Meta Superintelligence Labs 首款“实时音频感知”模型,隶属 Muse Spark 家族。它采用自回归多模态架构,把音频每 80 毫秒切成一块转为 soft token 输入模型,因此能边听边输出文字,不必等整段录音结束再处理。
官方公布的核心规格如下:
- 单一模型原生完成三件事:流式语音识别、20 人以上的说话人分离(谁在说话)、语句端点检测,不需另接后处理流水线。
- 训练覆盖 70 种以上语言,其中 25 种经完整验证,包含中文、日文、越南文、西班牙文;支持同一句话里跨语言 code-switching。
- 可用语言、关键词或场景“偏置”提示,提升人名、产品名等专有名词识别率。
- 自适应延迟:依字词难度决定何时输出结果,简单词先出、难词多等一点。
- 原生支持超过一小时的连续录音。
官方数据为流式词错率(WER)3.1%,说话人分离错误率 17.5%(以 AMI-IHM、AMI-SDM、VoxConverse 三个基准计),并在发布当日登上 Artificial Analysis 流式语音识别榜与公开分离基准榜首。
技术意义:三条流水线合成一条
过去的会议逐字稿多是“识别模型+分离模型+断句规则”三段拼接,各段延迟与错误互相叠加。Muse Voice Transcribe 把三项任务放进同一个自回归模型,延迟可控、上下文共享——模型知道上一句是谁说的,断句与分离能互相参考。80 毫秒切块加自适应延迟,则是在“实时”与“准确”之间折中的具体做法。
与竞品比较与获取方式
Meta Model API 定价为每 1,000 音频分钟 3 美元(约每小时 0.18 美元),且已含说话人分离;多数同类服务定价高于此,分离功能也常需另计,此价位属市场低价区间。即日起三个入口可用:Meta Model API、Muse Code,以及 Meta AI for Mac(按 Fn 键即可语音听写)。Meta 同时声明音频不永久存储,逐字稿会标注“AI 生成,可能有误”。
对管理者的意义
在泰国的台/中/泰三语团队,会议常是中文、泰文、英文混说,人工整理纪要慢又易漏。这款模型的跨语言混说与自动区分发言人,加上每小时约 6 泰铢(依汇率换算)的成本,值得评估替代人工会议记录。但泰文不在 25 种完整验证语言之列,正式导入前应先用真实会议录音实测泰文段落准确率,再决定是否全面采用。
大家怎么说 · 3 条留言