2026年顶尖开源ASR模型对比:词错误率、语种支持、延迟与许可证
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
开源语音识别领域已不限于Whisper,多个模型在Open ASR排行榜上实现了低于6%的词错误率。关键发展包括Cohere Transcribe、IBM Granite Speech 4.1以及多种针对吞吐量、流式处理和语言覆盖的模型。报告强调,许可证、语言支持、吞吐量和流式处理能力现在比单纯的排行榜排名更为重要。
开源ASR领域已经超越了Whisper单一模型时代。2026年3月,Cohere发布了Transcribe(2B参数,Apache 2.0许可证),平均词错误率为5.42%;随后IBM的Granite Speech 4.1 2B以5.33%紧随其后。ARK-ASR-3B和MOSS-Transcribe-preview-2B后来也取得了更低的数字。然而,由于测试集组成不同,排行榜分数无法直接比较;Cohere的分数在ARK使用的相同七个测试集上重新计算后,从5.42%下降到5.84%。来自Appen的私有评估集进一步改变了排名。Cohere Transcribe拥有强大的生产环境支持和人工偏好优势。IBM Granite Speech 4.1提供更多功能,如关键词偏置和标点符号。Canary-Qwen-2.5B支持转录或大语言模型模式。Qwen3-ASR覆盖52种语言。在吞吐量方面,Parakeet TDT 0.6B v3以实时因子3332.74领先,而Granite Speech 4.2B-NAR是非自回归模型。在流式处理方面,Voxtral Mini 4B Realtime和Kyutai STT提供低延迟。Meta的Omnilingual ASR覆盖1600多种语言。Whisper large-v3因其MIT许可证和生态系统仍然具有相关性。Interfaze的diffusion-gemma-asr模型在架构上新颖,但不可部署。MOSS-Transcribe-Diarize集成了说话人标签。许可证选择出现分化:Apache 2.0(Cohere、IBM、Qwen),MIT(Whisper),CC-BY-4.0(Canary、Parakeet、Kyutai)。建议团队根据许可证、语言覆盖范围、流式处理与批量处理、自身音频的词错误率以及每音频小时成本进行评估。
来源: MarkTechPost —
原文
