Los mejores modelos ASR abiertos de 2026: comparativa de WER, idiomas, latencia y licencia
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
El panorama del reconocimiento de voz abierto se ha diversificado más allá de Whisper, con múltiples modelos que logran un WER inferior al 6% en el Open ASR Leaderboard. Los desarrollos clave incluyen Cohere Transcribe, IBM Granite Speech 4.1 y varios modelos optimizados para rendimiento, transmisión en flujo continuo y cobertura de idiomas. El informe destaca que la licencia, el soporte de idiomas, el rendimiento y la capacidad de transmisión en flujo continuo son ahora más críticos que la posición bruta en el ranking.
El campo del ASR abierto ha superado la monocultura de Whisper. En marzo de 2026, Cohere lanzó Transcribe (2B, Apache 2.0) con un WER promedio del 5,42 %, seguido por Granite Speech 4.1 2B de IBM con un 5,33 %. Posteriormente, ARK-ASR-3B y MOSS-Transcribe-preview-2B publicaron cifras más bajas. Sin embargo, las puntuaciones de los líderes no son directamente comparables debido a las diferentes composiciones de los conjuntos de prueba; la puntuación de Cohere baja del 5,42 % al 5,84 % cuando se recalcula sobre los mismos siete conjuntos que ARK. Los conjuntos de evaluación privados de Appen reordenan aún más las clasificaciones. Cohere Transcribe cuenta con un sólido soporte de producción y gana en preferencia humana. IBM Granite Speech 4.1 ofrece más funciones, como sesgo de palabras clave y puntuación. Canary-Qwen-2.5B funciona en modo de transcripción o modo LLM. Qwen3-ASR cubre 52 idiomas. En cuanto al rendimiento, Parakeet TDT 0.6B v3 lidera con RTFx de 3332,74, mientras que Granite Speech 4.2B-NAR no es autorregresivo. Para streaming, Voxtral Mini 4B Realtime y Kyutai STT ofrecen baja latencia. El Omnilingual ASR de Meta cubre más de 1600 idiomas. Whisper large-v3 sigue siendo relevante debido a su licencia MIT y su ecosistema. El modelo diffusion-gemma-asr de Interfaze es novedoso desde el punto de vista arquitectónico, pero no es desplegable. MOSS-Transcribe-Diarize integra etiquetas de hablante. Las opciones de licencia se dividen: Apache 2.0 (Cohere, IBM, Qwen), MIT (Whisper), CC-BY 4.0 (Canary, Parakeet, Kyutai). Se recomienda a los equipos que evalúen según la licencia, la cobertura de idiomas, el streaming frente a lotes, su propio WER de audio y el costo por hora de audio.
Fuente: MarkTechPost —
original
