OnderzoekModellen 🇺🇸 27.07.2026 10:05

FFASR-leaderboard gelanceerd — een benchmark voor het evalueren van ASR in realistische akoestische omstandigheden

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies en Hugging Face hebben het FFASR-leaderboard gelanceerd, de eerste open community-benchmark voor het evalueren van automatische spraakherkenningssystemen (ASR) in verre-veld-omstandigheden. De benchmark toont aan dat bij een lage signaal-ruisverhouding (SNR) de foutenpercentages bij verre-veldherkenning meerdere malen hoger zijn dan bij nabij-veld. Het platform maakt evaluatie mogelijk van zowel nauwkeurigheid (woordfoutenpercentage, WER) als snelheid (real-time factor, RTFx) van modellen.
Treble Technologies en Hugging Face hebben de FFASR Leaderboard geïntroduceerd, de eerste open en door de gemeenschap ondersteunde benchmark voor het evalueren van automatische spraakherkenningsmodellen (ASR) in realistische omstandigheden met verre velden en akoestisch complexe omgevingen: nagalm, ruis en microfoonafstand. De benchmark maakt gebruik van de hybride simulator van Treble, die een golfoplosser voor lage en middenfrequenties combineert met geometrische akoestiek voor hoge frequenties, waardoor fysieke verschijnselen in 14 verschillende ruimtes met een volume van 20 tot 470 kubieke meter nauwkeurig worden gemodelleerd. Evaluatie vindt plaats op basis van negen condities, waarvan er vier de hoofdranglijst vormen, en omvat ook tracks voor validatie van simulatie (Lab Measured en Lab Simulated) en een bètaversie met een bewegende geluidsbron. Voor elke inzending worden de Word Error Rate (WER) voor negen condities en de RTFx (audio-seconden per seconde inferentie) op een NVIDIA L4 GPU vastgelegd. De resultaten van alle ingestuurde modellen laten een aanhoudende kloof zien: de WER in het verre veld bij een lage signaal-ruisverhouding is meerdere malen hoger dan in het nabije veld, en de visualisatie van de Pareto-front toont duidelijk de afweging tussen nauwkeurigheid en snelheid. De benchmark ondersteunt architecturen zoals Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain en andere via de Hub, en voor complexe stacks kan men een eigen evaluator maken. De ontwikkelaars zijn van plan om scenario's met meerdere sprekers, ondersteuning voor microfoonarrays en echo-onderdrukking toe te voegen.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws