ModelosCódigo Aberto 🇺🇸 24.07.2026 00:05

Melhores Modelos ASR Abertos de 2026: Comparação de WER, Idiomas, Latência e Licenças

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
O mercado de reconhecimento de fala (ASR) aberto não é mais uma monocultura do Whisper: nos últimos 12 meses, surgiram muitos modelos competitivos. Os líderes do Open ASR Leaderboard estão separados por menos de um ponto percentual no WER, então os fatores decisivos se tornaram licença, cobertura de idiomas, suporte a streaming e custo por hora de áudio. O artigo compara os principais modelos em detalhes por esses parâmetros e fornece recomendações para seleção.
Nos últimos 12 meses, o mercado de reconhecimento automático de fala (ASR, na sigla em inglês) aberto deixou de ser uma monocultura do Whisper. Em março de 2026, a Cohere lançou o Transcribe (2 bilhões de parâmetros, Apache 2.0), que liderou o ranking do Open ASR Leaderboard no Hugging Face com uma taxa média de erro de palavras (WER, na sigla em inglês) de 5,42%. Cinco semanas depois, a IBM lançou o Granite Speech 4.1 2B com 5,33%, e em seguida o ARK-ASR-3B e o MOSS-Transcribe-preview-2B mostraram valores ainda mais baixos. Os líderes do ranking agora estão separados por menos de um ponto percentual de WER, tornando o ranking não o único critério de escolha. São importantes a licença, a cobertura de idiomas, o suporte a streaming e o custo por hora de áudio. O artigo observa que a média de WER no leaderboard não é um valor fixo: os modelos foram testados em diferentes conjuntos de dados. Por exemplo, o Cohere Transcribe obteve 5,42% em oito conjuntos de teste em inglês, incluindo TED-LIUM, enquanto o ARK-ASR-3B teve 5,04% em sete conjuntos sem TED-LIUM, o que infla sua média. Se recalcularmos o Cohere nos mesmos sete conjuntos, seu WER seria de 5,84%, e o Granite Speech 4.1 2B, 5,65%. Alguns modelos, como o MOSS-Transcribe-preview-2B, foram refinados com aprendizado por reforço nas divisões de treinamento do leaderboard, o que infla seus resultados. Conjuntos de teste privados da Appen alteram a ordem no ranking: neles, o zoom/scribe_v1 assume a liderança. Entre os modelos, destacam-se: Cohere Transcribe — 2 bilhões de parâmetros, Apache 2.0, 14 idiomas, baixado mais de 620.000 vezes no mês; Granite Speech 4.1 2B — Apache 2.0, 6 idiomas, ASR + tradução bidirecional de fala, RTFx 231,29; Canary-Qwen-2.5B — 2,5 bilhões de parâmetros, CC-BY-4.0, inglês, WER 5,63%, RTFx 418; Qwen3-ASR-1.7B — Apache 2.0, 52 idiomas e dialetos, WER 5,76%. Na categoria de capacidade de processamento, lideram: Parakeet TDT 0.6B v3 (0,6 bilhões de parâmetros, CC-BY-4.0, RTFx 3332,74, 25 idiomas europeus, WER 6,32%), Granite Speech 4.1 2B-NAR (não autorregressivo, RTFx ~1820) e Qwen3-ASR-0.6B (52 idiomas, RTFx ~2000). Para streaming: Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 idiomas, latência a partir de 80 ms, roda em GPU de 16 GB) e Kyutai STT (CC-BY-4.0, inglês/francês, latência de 0,5 s, com VAD semântico integrado). O Meta Omnilingual ASR (Apache 2.0) suporta nativamente mais de 1600 idiomas e até mais de 5400 por aprendizado zero-shot. O Whisper large-v3 (MIT, 99 idiomas) continua sendo a melhor escolha para projetos onde a mínima exigência de licenciamento é importante. Entre as novidades de pesquisa: diffusion-gemma-asr-small (geração por difusão paralela com remoção de ruído, 42 milhões de parâmetros treinados) e MOSS-Transcribe-Diarize 0.9B (Apache 2.0, mais de 50 idiomas, realiza reconhecimento e diarização em uma única passagem). Divisão de licenças: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) e CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). A Meta divide as licenças: Apache 2.0 para modelos, CC-BY para o corpus. Recomenda-se escolher o modelo na seguinte ordem: licença, cobertura de idiomas, modo streaming ou lote, depois medição de WER em seus próprios dados de áudio e cálculo do custo por hora de áudio em seu próprio hardware. A principal conclusão: um modelo aberto com 2 bilhões de parâmetros sob licença permissiva agora supera o que as APIs fechadas ofereciam há 18 meses, e a escolha se resume a uma decisão de aquisição, não de pesquisa.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas