專欄 AI 管理編年史 第 255/303 講 查看課程目錄

Meta 發表 Muse Voice Transcribe:單一模型即時辨識、分辨 20 人以上說話、每小時 0.18 美元

01/09/2026 241
3:53
Meta 發表 Muse Voice Transcribe:單一模型即時辨識、分辨 20 人以上說話、每小時 0.18 美元
圖/Photo by Kevin Gonzalez on Unsplash

Meta Superintelligence Labs 9 月 1 日推出首款即時音訊感知模型 Muse Voice Transcribe,單一模型完成串流語音辨識、20 人以上說話者分離與語句端點偵測,支援同句跨語言混講,串流 WER 3.1%,API 定價每 1,000 音訊分鐘 3 美元。

Meta 於 2026 年 9 月 1 日(太平洋時間上午 10 點)在 research.meta.ai 發表 Muse Voice Transcribe,這是 Meta Superintelligence Labs 首款「即時音訊感知」模型,隸屬 Muse Spark 家族。它採自迴歸多模態架構,把音訊每 80 毫秒切成一塊轉為 soft token 餵入模型,因此能邊聽邊輸出文字,不必等整段錄音結束再處理。

官方公布的核心規格如下:

  • 單一模型原生完成三件事:串流語音辨識、20 人以上的說話者分離(誰在講話)、語句端點偵測,不需另接後處理管線。
  • 訓練涵蓋 70 種以上語言,其中 25 種經完整驗證,包含中文、日文、越南文、西班牙文;支援同一句話裡跨語言 code-switching。
  • 可用語言、關鍵字或情境「偏置」提示,提升人名、產品名等專有名詞辨識率。
  • 自適應延遲:依字詞難度決定何時吐出結果,簡單詞先出、難詞多等一點。
  • 原生支援超過一小時的連續錄音。

官方數據為串流字錯率(WER)3.1%,說話者分離錯誤率 17.5%(以 AMI-IHM、AMI-SDM、VoxConverse 三個基準計),並在發表當日登上 Artificial Analysis 串流語音辨識榜與公開分離基準榜首。

技術意義:三條管線合成一條

過去的會議逐字稿多是「辨識模型+分離模型+斷句規則」三段拼接,各段延遲與錯誤互相疊加。Muse Voice Transcribe 把三項任務放進同一個自迴歸模型,延遲可控、上下文共享——模型知道上一句是誰講的,斷句與分離能互相參考。80 毫秒切塊加自適應延遲,則是在「即時」與「準確」之間折衷的具體做法。

與競品比較與取得方式

Meta Model API 定價為每 1,000 音訊分鐘 3 美元(約每小時 0.18 美元),且已含說話者分離;多數同類服務定價高於此,分離功能也常需另計,此價位屬市場低價區間。即日起三個入口可用:Meta Model API、Muse Code,以及 Meta AI for Mac(按 Fn 鍵即可語音聽寫)。Meta 同時聲明音訊不永久儲存,逐字稿會標註「AI 產生,可能有誤」。

對管理者的意義

在泰國的台/中/泰三語團隊,會議常是中文、泰文、英文混講,人工整理紀錄慢又易漏。這款模型的跨語言混講與自動分辨發言者,加上每小時約 6 泰銖(依匯率換算)的成本,值得評估取代人工會議記錄。但泰文不在 25 種完整驗證語言之列,正式導入前應先用真實會議錄音實測泰文段落準確率,再決定是否全面採用。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Gemini 3.8 Flash 與 Flash Cyber 發表:三週內第三款 Flash,入門價撐到年底

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策