Los mejores modelos ASR abiertos de 2026: comparativa de WER, idiomas, latencia y licencias
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
El mercado de reconocimiento de voz (ASR) abierto ya no es un monocultivo de Whisper: durante los últimos 12 meses han surgido muchos modelos competitivos. Los líderes del ranking Open ASR están separados por menos de un punto porcentual en WER, por lo que los factores decisivos se han convertido en la licencia, la cobertura de idiomas, el soporte para streaming y el costo por hora de audio. El artículo compara los principales modelos en detalle según estos parámetros y proporciona recomendaciones para la selección.
En los últimos 12 meses, el mercado del reconocimiento automático del habla (ASR, por sus siglas en inglés) de código abierto dejó de ser un monocultivo de Whisper. En marzo de 2026, Cohere lanzó Transcribe (2 mil millones de parámetros, licencia Apache 2.0), que encabezó el ranking del Open ASR Leaderboard en Hugging Face con una tasa de error por palabra (WER, por sus siglas en inglés) promedio del 5,42%. Cinco semanas después, IBM lanzó Granite Speech 4.1 2B con un resultado del 5,33%, y luego ARK-ASR-3B y MOSS-Transcribe-preview-2B mostraron valores aún más bajos. A los líderes del ranking ahora los separa menos de un punto porcentual en WER, lo que hace que el ranking no sea el único criterio de selección. Importan la licencia, la cobertura de idiomas, el soporte para transmisión en tiempo real (streaming) y el costo por hora de audio. El artículo señala que el promedio de WER en el ranking no es un valor fijo: los modelos se probaron en diferentes conjuntos de datos. Por ejemplo, Cohere Transcribe obtuvo un 5,42% en ocho conjuntos de prueba en inglés, incluido TED-LIUM, mientras que ARK-ASR-3B obtuvo un 5,04% en siete conjuntos sin TED-LIUM, lo que infla su promedio. Si se recalcula Cohere con los mismos siete conjuntos, su WER sería del 5,84%, y el de Granite Speech 4.1 2B, del 5,65%. Algunos modelos, como MOSS-Transcribe-preview-2B, se ajustaron con aprendizaje por refuerzo (reinforcement learning) en las particiones de entrenamiento del ranking, lo que infla sus resultados. Los conjuntos de prueba privados de Appen cambian el orden del ranking: en ellos, zoom/scribe_v1 se sitúa en primer lugar. Entre los modelos destacan: Cohere Transcribe — 2 mil millones de parámetros, licencia Apache 2.0, 14 idiomas, descargado más de 620 mil veces en un mes; Granite Speech 4.1 2B — Apache 2.0, 6 idiomas, ASR más traducción bidireccional de voz, RTFx 231,29; Canary-Qwen-2.5B — 2,5 mil millones de parámetros, licencia CC-BY-4.0, inglés, WER 5,63%, RTFx 418; Qwen3-ASR-1.7B — Apache 2.0, 52 idiomas y dialectos, WER 5,76%. En la categoría de rendimiento (throughput) lideran: Parakeet TDT 0.6B v3 (0,6 mil millones de parámetros, CC-BY-4.0, RTFx 3332,74, 25 idiomas europeos, WER 6,32%), Granite Speech 4.1 2B-NAR (no autorregresivo, RTFx ~1820) y Qwen3-ASR-0.6B (52 idiomas, RTFx ~2000). Para transmisión en tiempo real: Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 idiomas, latencia desde 80 ms, funciona en GPU de 16 GB) y Kyutai STT (CC-BY-4.0, inglés/francés, latencia 0,5 s, con VAD semántico integrado). Meta Omnilingual ASR (Apache 2.0) admite de forma nativa más de 1600 idiomas y hasta más de 5400 mediante aprendizaje de cero disparos (zero-shot). Whisper large-v3 (licencia MIT, 99 idiomas) sigue siendo la mejor opción para proyectos donde la carga de licencia mínima es importante. Entre las novedades de investigación: diffusion-gemma-asr-small (generación paralela por eliminación de ruido difusiva, 42 millones de parámetros entrenados) y MOSS-Transcribe-Diarize 0.9B (Apache 2.0, más de 50 idiomas, realiza reconocimiento y diarización en una sola pasada). División por licencias: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe), MIT (Whisper large-v3) y CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta divide las licencias: Apache 2.0 para los modelos, CC-BY para el corpus. Se recomienda elegir el modelo en el siguiente orden: licencia, cobertura de idiomas, modo en tiempo real o por lotes, luego medir la WER en datos de audio propios y calcular el costo por hora de audio en el propio hardware. La conclusión principal: un modelo abierto con 2 mil millones de parámetros bajo una licencia permisiva ahora supera lo que las API cerradas ofrecían hace 18 meses, y la elección se reduce a una decisión de compra, no de investigación.
Fuente: MarkTechPost —
original
