Lançado o FFASR Leaderboard: Benchmark para Avaliar ASR em Condições Acústicas Reais
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
A Hugging Face e a Treble Technologies lançaram o Far-Field ASR (FFASR) Leaderboard, o primeiro benchmark aberto e orientado pela comunidade para avaliar modelos de ASR em condições realistas de campo distante, como reverberação, ruído de fundo e distância do microfone. Os resultados iniciais mostram que a WER em campo distante com baixo SNR é várias vezes maior do que a WER em campo próximo, destacando uma lacuna significativa entre o desempenho em benchmarks e a implantação no mundo real.
O FFASR Leaderboard, criado pela Hugging Face e pela Treble Technologies, é o primeiro benchmark aberto comunitário para avaliar modelos de ASR em condições acústicas realistas de campo distante. Ele aborda a lacuna persistente entre o desempenho em benchmarks e a implementação no mundo real, onde modelos que pontuam bem em benchmarks padrão de campo próximo frequentemente se degradam substancialmente sob reverberação, ruído de fundo e distância do microfone. O leaderboard avalia modelos em nove condições, com quatro determinando a pontuação principal do ranking. Os dados acústicos são gerados usando o motor de simulação híbrido da Treble, combinando modelagem baseada em ondas e acústica geométrica para capturar fenômenos como difração e interferência. Quatorze salas totalmente mobiliadas estão incluídas, variando de 20 a 470 m³. Além da WER (Word Error Rate, Taxa de Erro de Palavras), o leaderboard relata o RTFx (segundos de áudio por segundo de inferência) para cada submissão, avaliado em uma GPU NVIDIA L4. Os resultados iniciais mostram que a WER em campo distante com baixa SNR (Signal-to-Noise Ratio, Relação Sinal-Ruído) é várias vezes maior do que a WER em campo próximo. O leaderboard suporta variantes do Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain e a maioria das outras arquiteturas de ASR por meio da submissão do ID do modelo da Hugging Face. Uma opção de avaliador personalizado permite pilhas de inferência mais complexas. Planos futuros incluem cenários com múltiplos falantes, avaliação de arranjos de microfones e cancelamento de eco.
Fonte: Hugging Face blog —
original
