Lançado o FFASR Leaderboard — um Benchmark para Avaliar ASR em Condições Acústicas Reais
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
A Treble Technologies e a Hugging Face lançaram o FFASR Leaderboard, o primeiro benchmark comunitário aberto para avaliar sistemas de reconhecimento automático de fala (ASR) em condições de campo distante. O benchmark mostra que, em baixa relação sinal-ruído (SNR), as taxas de erro de reconhecimento em campo distante são várias vezes maiores do que em campo próximo. A plataforma permite avaliar tanto a precisão (taxa de erro de palavra, WER) quanto a velocidade (fator de tempo real, RTFx) dos modelos.
As empresas Treble Technologies e Hugging Face lançaram o FFASR Leaderboard, o primeiro benchmark aberto e mantido pela comunidade para avaliar modelos de ASR (Reconhecimento Automático de Fala) em condições realistas de campo distante com ambientes acusticamente complexos: reverberação, ruídos e afastamento do microfone. O benchmark utiliza o simulador híbrido da Treble, que combina um resolvedor de ondas para frequências baixas e médias com acústica geométrica para frequências altas, permitindo modelar com precisão fenômenos físicos em 14 salas diferentes, com volumes de 20 a 470 m³. A avaliação é realizada em nove condições, quatro das quais formam a classificação principal, e inclui também trilhas para validação da simulação (Lab Measured e Lab Simulated) e uma versão beta com fonte sonora em movimento. Para cada submissão, são registrados o Word Error Rate (WER) para as nove condições e o RTFx (segundos de áudio por segundo de inferência) em uma GPU NVIDIA L4. Os resultados de todos os modelos submetidos mostram uma lacuna consistente: o WER em campo distante com baixa relação sinal-ruído (SNR) é várias vezes maior do que em campo próximo, e a visualização da fronteira de Pareto demonstra claramente o compromisso entre precisão e velocidade. O benchmark suporta arquiteturas como Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain e outras por meio do Hugging Face Hub, e para pilhas complexas é possível criar um avaliador personalizado. Os desenvolvedores planejam adicionar cenários com múltiplos falantes, suporte a arranjos de microfones e cancelamento de eco.
Fonte: Hugging Face blog —
original
