FFASR Leaderboard gestartet – ein Benchmark zur Bewertung von ASR unter realen akustischen Bedingungen
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Treble Technologies und Hugging Face haben das FFASR Leaderboard gestartet, den ersten offenen Community-Benchmark zur Bewertung von automatischen Spracherkennungssystemen (Automatic Speech Recognition, ASR) in Fernfeldbedingungen. Der Benchmark zeigt, dass bei niedrigem Signal-Rausch-Verhältnis (Signal-to-Noise Ratio, SNR) die Fehlerraten der Fernfelderkennung um ein Vielfaches höher sind als im Nahfeld. Die Plattform ermöglicht die Bewertung sowohl der Genauigkeit (Wortfehlerrate, Word Error Rate, WER) als auch der Geschwindigkeit (Echtzeitfaktor, Real-Time Factor, RTFx) der Modelle.
Die Unternehmen Treble Technologies und Hugging Face haben das FFASR Leaderboard vorgestellt – den ersten offenen und von der Community unterstützten Benchmark zur Bewertung von ASR-Modellen unter realistischen Fernfeldbedingungen mit akustisch anspruchsvollem Umfeld, das heißt mit Nachhall, Störgeräuschen und entfernter Mikrofonposition. Der Benchmark nutzt den hybriden Simulator von Treble, der einen Wellenlöser für tiefe und mittlere Frequenzen mit geometrischer Akustik für hohe Frequenzen kombiniert, um physikalische Phänomene in 14 verschiedenen Räumen mit Volumina von 20 bis 470 Kubikmeter präzise zu modellieren. Die Bewertung erfolgt anhand von neun Bedingungen, von denen vier die Hauptwertung bilden; hinzu kommen Tracks zur Validierung der Simulation (Lab Measured und Lab Simulated) sowie eine Beta-Version mit einer sich bewegenden Schallquelle. Für jeden Eintrag wird die Word Error Rate (WER) für die neun Bedingungen sowie der RTFx (Audiosekunden pro Inferenzsekunde) auf einer NVIDIA L4 GPU erfasst. Die Ergebnisse aller eingereichten Modelle zeigen eine deutliche Kluft: Die WER im Fernfeld bei niedrigem Signal-Rausch-Verhältnis ist um ein Vielfaches höher als im Nahfeld, und die Visualisierung der Pareto-Front verdeutlicht den Zielkonflikt zwischen Genauigkeit und Geschwindigkeit. Der Benchmark unterstützt die Architekturen Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain und weitere über den Hub; für komplexe Stapel kann ein eigener Evaluator erstellt werden. Die Entwickler planen, Szenarien mit mehreren Sprechern, Unterstützung für Mikrofon-Arrays und Echounterdrückung zu ergänzen.
Quelle: Hugging Face blog —
Original
