OnderzoekModellen 🇺🇸 27.07.2026 10:05

FFASR Leaderboard Gelanceerd: Benchmark voor Evaluatie van ASR in Realistische Akoestische Omstandigheden

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Hugging Face en Treble Technologies hebben de Far-Field ASR (FFASR) Leaderboard gelanceerd, de eerste open community-gedreven benchmark voor het evalueren van ASR-modellen onder realistische verre-veldcondities zoals nagalm, achtergrondgeluid en microfoonafstand. Eerste resultaten tonen aan dat de verre-veld WER bij lage SNR meerdere malen hoger is dan de nabije-veld WER, wat een aanzienlijke kloof blootlegt tussen benchmarkprestaties en daadwerkelijke inzet.
De FFASR-leaderboard, gecreëerd door Hugging Face en Treble Technologies, is de eerste open, door de gemeenschap gedreven benchmark voor het evalueren van ASR-modellen onder realistische verre-veldakoestische omstandigheden. Het adresseert de aanhoudende kloof tussen benchmarkprestaties en daadwerkelijke implementatie, waarbij modellen die goed scoren op standaard nabije-veldbenchmarks vaak aanzienlijk verslechteren onder nagalm, achtergrondgeluid en microfoonafstand. De leaderboard evalueert modellen in negen omstandigheden, waarvan er vier de primaire rangschikkingsscore bepalen. Akoestische data wordt gegenereerd met behulp van Treble's hybride simulatie-engine, die golfgebaseerde en geometrische-akoestische modellering combineert om fenomenen zoals diffractie en interferentie vast te leggen. Veertien volledig ingerichte ruimtes zijn opgenomen, variërend van 20 tot 470 m³. Naast WER rapporteert de leaderboard RTFx (audio seconden per inferentieseconde) voor elke inzending, geëvalueerd op een NVIDIA L4 GPU. Voorlopige resultaten tonen aan dat de verre-veld-WER bij lage signaal-ruisverhouding (SNR) meerdere malen hoger is dan de nabije-veld-WER. De leaderboard ondersteunt Whisper-varianten, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain en de meeste andere ASR-architecturen via Hugging Face model-ID-inzending. Een optie voor een aangepaste evaluator maakt complexere inferentiestapels mogelijk. Toekomstige plannen omvatten multi-spreker-scenario's, microfoonarray-evaluatie en echo-onderdrukking.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws