Mistral 发布 Voxtral Transcribe 2:新一代语音模型主打超低延迟实时转录
法国 Mistral AI 于 2026 年 2 月 4 日发布 Voxtral Transcribe 2,一次推出两款新一代语音转文字模型——主打顶尖转录质量与说话人分离的 Voxtral Mini Transcribe V2,以及专为实时场景设计、延迟可低于 200 毫秒的开源 Voxtral Realtime。
法国生成式 AI 新创公司 Mistral AI 于 2026 年 2 月 4 日发布 Voxtral Transcribe 2,是继 2025 年 7 月首代 Voxtral 语音理解模型之后的新一代语音转文字(speech-to-text)产品线,一次推出两款模型。Voxtral Mini Transcribe V2 主打业界顶尖的转录质量,具备说话人分离(speaker diarization)、上下文校准(context biasing)与逐字时间戳,支持 13 种语言,在 FLEURS 基准测试中字词错误率约 4%,定价约每分钟 0.003 美元。另一款 Voxtral Realtime 则专为实时流式场景打造,延迟可压低至 200 毫秒以下,并以 Apache 2.0 许可开源发布,让开发者可以自行部署在本地或私有云。Mistral 同时在自家 Mistral Studio 上线“音频游乐场”(audio playground),让用户可以实时试用转录与说话人分离功能。
技术意义:把“转录+说话人分离+实时流式”收敛成两款专用模型
语音转文字本身已相对成熟,但“说话人分离”与“低延迟实时处理”长期是企业场景中最容易卡壳的两个环节——会议记录、客服录音、庭审笔录等需要准确标注发言人,而语音助手、实时字幕等应用则要求毫秒级延迟。Voxtral Transcribe 2 把批量高精度转录(Mini Transcribe V2)与低延迟实时识别(Realtime)拆成两款专用模型分进合击,而不是用单一模型硬吃所有场景,反映厂商对“不同语音应用有不同技术取舍”的产品化思考。
与前代及竞品比较:从“听懂语音”到“实时听打”
2025 年 7 月首代 Voxtral 主打的是语音理解(转录、翻译、摘要、问答),这次 Voxtral Transcribe 2 则聚焦在转录场景本身的精准度与速度,并将 Voxtral Realtime 以开源形式发布,延续 Mistral 一贯“核心模型权重公开”的策略,与 OpenAI、Google 多将旗舰模型锁在付费 API 之后的路线不同。对重视数据隐私、不愿让录音上传第三方云端的行业(金融、医疗、法律)而言,这种可自行部署且性能不打折的开源选项格外有吸引力。
业界反应:语音转录赛道进入“实时化”竞速
多家科技媒体注意到 Voxtral Realtime 把延迟压到 200 毫秒以下、且以开源发布,被视为对实时语音应用(如客服语音机器人、会议实时字幕)门槛的又一次拉低。这也呼应近期 xAI、Anthropic 等厂商在同期密集发布新能力的态势,显示语音与音频处理正快速从“文字模型的周边延伸”升级为独立且激烈的竞争赛道。
对管理者而言,Voxtral Transcribe 2 这类可自行部署、支持实时字幕与说话人分离的工具,意味着会议记录自动化、客服录音质量稽核、多语言团队沟通记录留存等场景,未来有机会用更低成本、更高数据掌控度来实现,值得请技术团队评估纳入内部工具链的可行性。