InvestigaciónModelos 🇺🇸 27.07.2026 10:05

Lanzamiento del FFASR Leaderboard: Referencia para Evaluar ASR en Condiciones Acústicas Reales

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Hugging Face y Treble Technologies han lanzado el FFASR (Far-Field ASR) Leaderboard, el primer referente comunitario abierto para evaluar modelos de reconocimiento automático del habla (ASR) en condiciones realistas de campo lejano, como reverberación, ruido de fondo y distancia del micrófono. Los resultados iniciales muestran que la tasa de error de palabras (WER) en campo lejano con baja relación señal-ruido (SNR) es varias veces mayor que en campo cercano, lo que resalta una brecha significativa entre el rendimiento en referencias y el despliegue en el mundo real.
El FFASR Leaderboard, creado por Hugging Face y Treble Technologies, es el primer benchmark comunitario y abierto para evaluar modelos de ASR en condiciones acústicas realistas de campo lejano. Aborda la brecha persistente entre el rendimiento en benchmarks y el despliegue en el mundo real, donde los modelos que obtienen buenos resultados en benchmarks estándar de campo cercano a menudo se degradan sustancialmente bajo reverberación, ruido de fondo y distancia del micrófono. El leaderboard evalúa modelos en nueve condiciones, cuatro de las cuales determinan la puntuación principal de clasificación. Los datos acústicos se generan mediante el motor de simulación híbrido de Treble, que combina modelado basado en ondas y acústica geométrica para capturar fenómenos como difracción e interferencia. Se incluyen catorce habitaciones completamente amuebladas, que van desde 20 hasta 470 m³. Junto con el WER, el leaderboard informa el RTFx (segundos de audio por segundo de inferencia) para cada envío, evaluado en una GPU NVIDIA L4. Los resultados iniciales muestran que el WER en campo lejano con baja SNR es varias veces mayor que el WER en campo cercano. El leaderboard admite variantes de Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain y la mayoría de las otras arquitecturas de ASR mediante el envío del ID del modelo de Hugging Face. Una opción de evaluador personalizado permite stacks de inferencia más complejos. Los planes futuros incluyen escenarios de múltiples hablantes, evaluación de arreglos de micrófonos y cancelación de eco.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas