Principais Modelos ASR Abertos de 2026: Comparação de WER, Idiomas, Latência e Licença
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
O cenário de reconhecimento de fala aberto diversificou-se além do Whisper, com vários modelos alcançando WER inferior a 6% no Open ASR Leaderboard. Desenvolvimentos importantes incluem Cohere Transcribe, IBM Granite Speech 4.1 e vários modelos para throughput, streaming e cobertura de idiomas. O relatório enfatiza que licença, suporte a idiomas, throughput e capacidade de streaming são agora mais críticos do que a classificação bruta no leaderboard.
O campo de ASR aberto superou a monocultura do Whisper. Em março de 2026, a Cohere lançou o Transcribe (2B, Apache 2.0) com 5,42% de WER médio, seguido pelo Granite Speech 4.1 2B da IBM com 5,33%. Mais tarde, o ARK-ASR-3B e o MOSS-Transcribe-preview-2B registraram números mais baixos. No entanto, as pontuações do leaderboard não são diretamente comparáveis devido a diferentes composições de conjuntos de teste; a pontuação da Cohere cai de 5,42% para 5,84% quando recalculada nos mesmos sete conjuntos do ARK. Conjuntos de avaliação privados da Appen reordenam ainda mais os rankings. O Cohere Transcribe tem forte suporte de produção e vitórias em preferência humana. O IBM Granite Speech 4.1 oferece mais recursos, como ajuste de palavras-chave e pontuação. O Canary-Qwen-2.5B opera em modo de transcrição ou LLM. O Qwen3-ASR cobre 52 idiomas. Em throughput, o Parakeet TDT 0.6B v3 lidera com RTFx 3332,74, enquanto o Granite Speech 4.2B-NAR é não autorregressivo. Para streaming, o Voxtral Mini 4B Realtime e o Kyutai STT oferecem baixa latência. O Omnilingual ASR da Meta cobre mais de 1600 idiomas. O Whisper large-v3 continua relevante devido à sua licença MIT e ecossistema. O modelo diffusion-gemma-asr da Interfaze é arquiteturalmente novo, mas não implantável. O MOSS-Transcribe-Diarize integra rótulos de falante. As escolhas de licença se dividem: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Recomenda-se que as equipes avaliem com base em licença, cobertura de idiomas, streaming versus lote, WER de seu próprio áudio e custo por hora de áudio.
Fonte: MarkTechPost —
original
