ForschungModelle 🇺🇸 27.07.2026 10:05

FFASR Leaderboard gestartet: Benchmark zur Bewertung von ASR unter realen akustischen Bedingungen

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Hugging Face und Treble Technologies haben das Far-Field ASR (FFASR) Leaderboard ins Leben gerufen, den ersten offenen, gemeinschaftlich betriebenen Benchmark zur Bewertung von ASR-Modellen unter realistischen Fernfeldbedingungen wie Nachhall, Hintergrundgeräuschen und Mikrofonabstand. Erste Ergebnisse zeigen, dass die Wortfehlerrate im Fernfeld bei niedrigem Signal-Rausch-Abstand um ein Vielfaches höher ist als im Nahfeld, was eine erhebliche Lücke zwischen Benchmark-Leistung und realem Einsatz verdeutlicht.
Das FFASR-Ranking, erstellt von Hugging Face und Treble Technologies, ist der erste offene, gemeinschaftsgetriebene Benchmark zur Bewertung von ASR-Modellen unter realistischen Fernfeld-Akustikbedingungen. Es schließt die anhaltende Lücke zwischen Benchmark-Leistung und realer Nutzung, bei der Modelle, die in standardmäßigen Nahfeld-Benchmarks gut abschneiden, unter Nachhall, Hintergrundgeräuschen und Mikrofonentfernung oft erheblich nachlassen. Das Ranking bewertet Modelle unter neun Bedingungen, wobei vier für die primäre Rangfolge entscheidend sind. Die Akustikdaten werden mit der hybriden Simulationsengine von Treble generiert, die wellenbasierte und geometrische Akustikmodellierung kombiniert, um Phänomene wie Beugung und Interferenz zu erfassen. Vierzehn voll möblierte Räume von 20 bis 470 m³ sind enthalten. Neben der Wortfehlerrate (Word Error Rate, WER) gibt das Ranking für jede Einsendung den RTFx-Wert (Audio-Sekunden pro Inferenz-Sekunde) an, bewertet auf einer NVIDIA L4 GPU. Erste Ergebnisse zeigen, dass die Fernfeld-WER bei niedrigem Signal-Rausch-Verhältnis um ein Vielfaches höher ist als die Nahfeld-WER. Das Ranking unterstützt Whisper-Varianten, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain und die meisten anderen ASR-Architekturen über die Angabe einer Hugging-Face-Modell-ID. Eine Option für benutzerdefinierte Evaluatoren ermöglicht komplexere Inferenz-Stapel. Zukünftige Pläne umfassen Mehrsprecher-Szenarien, Mikrofonarray-Bewertung und Echounterdrückung.
Quelle: Hugging Face blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten