Meta 發表 Muse Voice Transcribe:單一模型即時辨識、分辨 20 人以上說話、每小時 0.18 美元
Meta Superintelligence Labs 9 月 1 日推出首款即時音訊感知模型 Muse Voice Transcribe,單一模型完成串流語音辨識、20 人以上說話者分離與語句端點偵測,支援同句跨語言混講,串流 WER 3.1%,API 定價每 1,000 音訊分鐘 3 美元。
Meta 於 2026 年 9 月 1 日(太平洋時間上午 10 點)在 research.meta.ai 發表 Muse Voice Transcribe,這是 Meta Superintelligence Labs 首款「即時音訊感知」模型,隸屬 Muse Spark 家族。它採自迴歸多模態架構,把音訊每 80 毫秒切成一塊轉為 soft token 餵入模型,因此能邊聽邊輸出文字,不必等整段錄音結束再處理。
官方公布的核心規格如下:
- 單一模型原生完成三件事:串流語音辨識、20 人以上的說話者分離(誰在講話)、語句端點偵測,不需另接後處理管線。
- 訓練涵蓋 70 種以上語言,其中 25 種經完整驗證,包含中文、日文、越南文、西班牙文;支援同一句話裡跨語言 code-switching。
- 可用語言、關鍵字或情境「偏置」提示,提升人名、產品名等專有名詞辨識率。
- 自適應延遲:依字詞難度決定何時吐出結果,簡單詞先出、難詞多等一點。
- 原生支援超過一小時的連續錄音。
官方數據為串流字錯率(WER)3.1%,說話者分離錯誤率 17.5%(以 AMI-IHM、AMI-SDM、VoxConverse 三個基準計),並在發表當日登上 Artificial Analysis 串流語音辨識榜與公開分離基準榜首。
技術意義:三條管線合成一條
過去的會議逐字稿多是「辨識模型+分離模型+斷句規則」三段拼接,各段延遲與錯誤互相疊加。Muse Voice Transcribe 把三項任務放進同一個自迴歸模型,延遲可控、上下文共享——模型知道上一句是誰講的,斷句與分離能互相參考。80 毫秒切塊加自適應延遲,則是在「即時」與「準確」之間折衷的具體做法。
與競品比較與取得方式
Meta Model API 定價為每 1,000 音訊分鐘 3 美元(約每小時 0.18 美元),且已含說話者分離;多數同類服務定價高於此,分離功能也常需另計,此價位屬市場低價區間。即日起三個入口可用:Meta Model API、Muse Code,以及 Meta AI for Mac(按 Fn 鍵即可語音聽寫)。Meta 同時聲明音訊不永久儲存,逐字稿會標註「AI 產生,可能有誤」。
對管理者的意義
在泰國的台/中/泰三語團隊,會議常是中文、泰文、英文混講,人工整理紀錄慢又易漏。這款模型的跨語言混講與自動分辨發言者,加上每小時約 6 泰銖(依匯率換算)的成本,值得評估取代人工會議記錄。但泰文不在 25 種完整驗證語言之列,正式導入前應先用真實會議錄音實測泰文段落準確率,再決定是否全面採用。