Meilleurs modèles ASR open source de 2026 : comparaison du WER, des langues, de la latence et des licences
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
Le marché de la reconnaissance vocale (ASR) open source n'est plus une monoculture de Whisper : au cours des 12 derniers mois, de nombreux modèles concurrents ont émergé. Les leaders du classement Open ASR Leaderboard sont séparés par moins d'un point de pourcentage en WER, de sorte que les facteurs décisifs sont devenus la licence, la couverture linguistique, le support du streaming et le coût par heure d'audio. L'article compare en détail les principaux modèles selon ces paramètres et fournit des recommandations pour la sélection.
Au cours des 12 derniers mois, le marché de la reconnaissance vocale ouverte (ASR) a cessé d'être une monoculture Whisper. En mars 2026, Cohere a publié Transcribe (2 milliards de paramètres, licence Apache 2.0), qui a pris la tête du classement Open ASR Leaderboard sur Hugging Face avec un taux d'erreur lexicale (WER) moyen de 5,42%. Cinq semaines plus tard, IBM a lancé Granite Speech 4.1 2B avec un score de 5,33%, puis ARK-ASR-3B et MOSS-Transcribe-preview-2B ont affiché des valeurs encore plus basses. Les leaders du classement sont désormais séparés par moins d'un point de pourcentage en WER, ce qui fait du classement un critère non unique de sélection. La licence, la couverture linguistique, la prise en charge du streaming et le coût par heure audio sont désormais importants. L'article note que le WER moyen sur le leaderboard n'est pas une valeur fixe : les modèles ont été testés sur différents ensembles de données. Par exemple, Cohere Transcribe a obtenu 5,42% sur huit ensembles de test anglais, dont TED-LIUM, tandis qu'ARK-ASR-3B a obtenu 5,04% sur sept ensembles sans TED-LIUM, ce qui gonfle sa moyenne. Si l'on recalcule Cohere sur les mêmes sept ensembles, son WER serait de 5,84%, et celui de Granite Speech 4.1 2B de 5,65%. Certains modèles, comme MOSS-Transcribe-preview-2B, ont été affinés par renforcement sur les sections d'entraînement du leaderboard, ce qui gonfle leurs résultats. Les ensembles de test privés d'Appen changent l'ordre du classement : sur ces ensembles, zoom/scribe_v1 prend la première place. Parmi les modèles notables : Cohere Transcribe (2 milliards de paramètres, licence Apache 2.0, 14 langues, téléchargé plus de 620 000 fois en un mois) ; Granite Speech 4.1 2B (licence Apache 2.0, 6 langues, ASR + traduction vocale bidirectionnelle, RTFx 231,29) ; Canary-Qwen-2.5B (2,5 milliards de paramètres, licence CC-BY-4.0, anglais, WER 5,63%, RTFx 418) ; Qwen3-ASR-1.7B (licence Apache 2.0, 52 langues et dialectes, WER 5,76%). Dans la catégorie du débit, les leaders sont : Parakeet TDT 0.6B v3 (0,6 milliard de paramètres, licence CC-BY-4.0, RTFx 3332,74, 25 langues européennes, WER 6,32%) ; Granite Speech 4.1 2B-NAR (non autorégressif, RTFx ~1820) et Qwen3-ASR-0.6B (52 langues, RTFx ~2000). Pour le streaming : Voxtral Mini 4B Realtime 2602 (licence Apache 2.0, 13 langues, latence à partir de 80 ms, fonctionne sur GPU 16 Go) et Kyutai STT (licence CC-BY-4.0, anglais/français, latence 0,5 s, avec VAD sémantique intégré). Meta Omnilingual ASR (licence Apache 2.0) prend en charge plus de 1600 langues de manière native et jusqu'à 5400+ via un apprentissage zero-shot. Whisper large-v3 (licence MIT, 99 langues) reste le meilleur choix pour les projets où la minimalité des contraintes de licence est importante. Parmi les nouveautés de recherche : diffusion-gemma-asr-small (génération par débruitage par diffusion parallèle, 42 millions de paramètres entraînés) et MOSS-Transcribe-Diarize 0.9B (licence Apache 2.0, 50+ langues, effectue la reconnaissance et la diarisation en un seul passage). Répartition des licences : Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) et CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta partage les licences : Apache 2.0 pour les modèles, CC-BY pour le corpus. Il est recommandé de choisir un modèle dans l'ordre suivant : licence, couverture linguistique, mode streaming ou batch, puis mesure du WER sur ses propres données audio et calcul du coût par heure audio sur son propre matériel. Conclusion principale : un modèle ouvert de 2 milliards de paramètres sous licence permissive surpasse désormais ce que les API fermées proposaient il y a 18 mois, et le choix se réduit à une décision d'achat, non de recherche.
Source: MarkTechPost —
original
