Meilleurs modèles ASR ouverts de 2026 : comparaison WER, langues, latence et licence
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
Le paysage de la reconnaissance vocale ouverte s'est diversifié au-delà de Whisper, avec plusieurs modèles atteignant un WER inférieur à 6% sur le classement Open ASR. Les développements clés incluent Cohere Transcribe, IBM Granite Speech 4.1, et divers modèles pour le débit, le streaming et la couverture linguistique. Le rapport souligne que la licence, la prise en charge des langues, le débit et la capacité de streaming sont désormais plus critiques que le simple classement dans le classement.
Le domaine de la reconnaissance automatique de la parole (ASR) open source a dépassé la monoculture de Whisper. En mars 2026, Cohere a publié Transcribe (2B, licence Apache 2.0) avec un taux d'erreur moyen (WER) de 5,42 %, suivi par Granite Speech 4.1 2B d'IBM à 5,33 %. ARK-ASR-3B et MOSS-Transcribe-preview-2B ont ensuite affiché des chiffres plus bas. Cependant, les scores des classements ne sont pas directement comparables en raison de compositions d'ensembles de test différentes ; le score de Cohere chute de 5,42 % à 5,84 % lorsqu'il est recalculé sur les sept mêmes ensembles que ceux d'ARK. Des ensembles d'évaluation privés d'Appen redistribuent encore les classements. Cohere Transcribe bénéficie d'un solide support en production et de préférences humaines favorables. IBM Granite Speech 4.1 propose davantage de fonctionnalités comme le biaisement de mots-clés et la ponctuation. Canary-Qwen-2.5B fonctionne en mode transcription ou LLM. Qwen3-ASR couvre 52 langues. En termes de débit, Parakeet TDT 0.6B v3 est en tête avec un RTFx de 3332,74, tandis que Granite Speech 4.2B-NAR est non autorégressif. Pour le streaming, Voxtral Mini 4B Realtime et Kyutai STT offrent une faible latence. Omnilingual ASR de Meta couvre plus de 1600 langues. Whisper large-v3 reste pertinent grâce à sa licence MIT et son écosystème. Le modèle diffusion-gemma-asr d'Interfaze est architecturalement novateur mais non déployable. MOSS-Transcribe-Diarize intègre les étiquettes de locuteurs. Les choix de licences se divisent : Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY-4.0 (Canary, Parakeet, Kyutai). Les équipes sont invitées à évaluer en fonction de la licence, de la couverture linguistique, du streaming par rapport au traitement par lots, du WER sur leurs propres fichiers audio et du coût par heure audio.
Source: MarkTechPost —
original
