模型开源 🇺🇸 27.07.2026 16:05

Mistral AI 发布 Voxtral Transcribe 2 — 超低延迟语音识别模型

MistralMistral Mistral AIMistral AI
Mistral AI 推出了 Voxtral Transcribe 2,这是一系列语音转文本模型,包括用于批量转录的 Voxtral Mini Transcribe V2 和用于实时应用、延迟低于 200 毫秒的 Voxtral Realtime。Voxtral Realtime 基于 Apache 2.0 许可证开放权重。两个模型均支持 13 种语言,并提供带有说话人分离功能的一流转录质量。
Mistral AI 发布了 Voxtral Transcribe 2,这是一款新一代的语音转文本模型系列。它包括用于批量转录的Voxtral Mini Transcribe V2,以及用于实时转录的Voxtral Realtime,后者延迟可配置至200毫秒以下。Voxtral Realtime 采用 Apache 2.0 许可证开放权重。两个模型均支持13种语言:英语、中文、印地语、西班牙语、阿拉伯语、法语、葡萄牙语、俄语、德语、日语、韩语、意大利语和荷兰语。Voxtral Mini Transcribe V2 在FLEURS基准测试中的词错误率约为4%,每分钟成本为0.003美元,性能优于GPT-4o mini Transcribe和Gemini 2.5 Flash等竞品。它还具备说话人分离、上下文偏移、词级时间戳、噪声鲁棒性,并支持长达3小时的音频。Voxtral Realtime 拥有40亿参数规模,可在边缘设备上高效运行,即使在480毫秒的延迟下也能提供接近离线的准确度。此外,Mistral 还在 Mistral Studio 中推出了一个音频游乐场,用于测试带有说话人分离和时间戳的转录。
来源: Mistral AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻