Se lanza FFASR Leaderboard — un punto de referencia para evaluar ASR en condiciones acústicas reales
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Treble Technologies y Hugging Face han lanzado FFASR Leaderboard, el primer punto de referencia comunitario abierto para evaluar sistemas de reconocimiento automático del habla (ASR) en condiciones de campo lejano. El benchmark muestra que, en relaciones señal-ruido (SNR) bajas, las tasas de error de reconocimiento en campo lejano son varias veces más altas que en campo cercano. La plataforma permite evaluar tanto la precisión (tasa de error de palabra, WER) como la velocidad (factor de tiempo real, RTFx) de los modelos.
Treble Technologies y Hugging Face han lanzado el FFASR Leaderboard, el primer benchmark abierto y mantenido por la comunidad para evaluar modelos de ASR en condiciones realistas de campo lejano con acústica compleja: reverberación, ruidos y distancia del micrófono. El benchmark utiliza el simulador híbrido de Treble, que combina un solver de ondas para frecuencias bajas y medias con acústica geométrica para frecuencias altas, lo que permite modelar con precisión fenómenos físicos en 14 salas diferentes con volúmenes de entre 20 y 470 m³. La evaluación se realiza en nueve condiciones, cuatro de las cuales forman la clasificación principal, e incluye también pistas para la validación de la simulación (Lab Measured y Lab Simulated) y una versión beta con fuente de sonido en movimiento. Para cada envío se registran la tasa de error de palabras (WER, por sus siglas en inglés) para las nueve condiciones y el RTFx (segundos de audio por segundo de inferencia) en una GPU NVIDIA L4. Los resultados de todos los modelos presentados muestran una brecha constante: el WER en campo lejano con baja relación señal-ruido (SNR, por sus siglas en inglés) es varias veces mayor que en campo cercano, y la visualización del frente de Pareto demuestra claramente el compromiso entre precisión y velocidad. El benchmark es compatible con las arquitecturas Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain y otras a través de Hub, y para pilas complejas se puede crear un evaluador personalizado. Los desarrolladores planean añadir escenarios con varios hablantes, compatibilidad con conjuntos de micrófonos y cancelación de eco.
Fuente: Hugging Face blog —
original
