Mistral 發表 Voxtral Transcribe 2:新一代語音模型主打超低延遲即時轉錄
法國 Mistral AI 於 2026 年 2 月 4 日發表 Voxtral Transcribe 2,一次推出兩款新一代語音轉文字模型——主打頂尖轉錄品質與語者分離的 Voxtral Mini Transcribe V2,以及專為即時場景設計、延遲可低於 200 毫秒的開源 Voxtral Realtime。
法國生成式 AI 新創 Mistral AI 於 2026 年 2 月 4 日發表 Voxtral Transcribe 2,是繼 2025 年 7 月首代 Voxtral 語音理解模型之後的新一代語音轉文字(speech-to-text)產品線,一次推出兩款模型。Voxtral Mini Transcribe V2 主打業界頂尖的轉錄品質,具備語者分離(speaker diarization)、上下文校準(context biasing)與逐字時間戳記,支援 13 種語言,在 FLEURS 基準測試中字詞錯誤率約 4%,定價約每分鐘 0.003 美元。另一款 Voxtral Realtime 則專為即時串流場景打造,延遲可壓低至 200 毫秒以下,並以 Apache 2.0 授權開源釋出,讓開發者可自行部署在地端或私有雲。Mistral 同時在自家 Mistral Studio 上線「音訊遊樂場」(audio playground),讓使用者可即時試用轉錄與語者分離功能。
技術意義:把「轉錄+語者分離+即時串流」收斂成兩款專用模型
語音轉文字本身已相對成熟,但「語者分離」與「低延遲即時處理」長期是企業場景中最容易卡關的兩個環節——會議紀錄、客服錄音、法庭筆錄等需要準確標示發言人,而語音助理、即時字幕等應用則要求毫秒級延遲。Voxtral Transcribe 2 把批次高精度轉錄(Mini Transcribe V2)與低延遲即時辨識(Realtime)拆成兩款專用模型分進合擊,而非用單一模型硬吃所有場景,反映廠商對「不同語音應用有不同技術取捨」的產品化思考。
與前代及競品比較:從「聽懂語音」到「即時聽打」
2025 年 7 月首代 Voxtral 主打的是語音理解(轉錄、翻譯、摘要、問答),這次 Voxtral Transcribe 2 則聚焦在轉錄場景本身的精準度與速度,並將 Voxtral Realtime 以開源形式釋出,延續 Mistral 一貫「核心模型權重公開」的策略,與 OpenAI、Google 多將旗艦模型鎖在付費 API 之後的路線不同。對重視資料隱私、不願讓錄音上傳第三方雲端的產業(金融、醫療、法律)而言,這種可自行部署且效能不打折的開源選項格外有吸引力。
業界反應:語音轉錄賽道進入「即時化」競速
多家科技媒體注意到 Voxtral Realtime 把延遲壓到 200 毫秒以下、且以開源釋出,被視為對即時語音應用(如客服語音機器人、會議即時字幕)門檻的又一次拉低。這也呼應近期 xAI、Anthropic 等廠商在同期密集發布新能力的態勢,顯示語音與音訊處理正快速從「文字模型的周邊延伸」升級為獨立且激烈的競爭賽道。
對管理者而言,Voxtral Transcribe 2 這類可自行部署、支援即時字幕與語者分離的工具,意味著會議紀錄自動化、客服錄音品質稽核、多語言團隊溝通紀錄留存等場景,未來有機會用更低成本、更高資料掌控度來實現,值得請技術團隊評估納入內部工具鏈的可行性。