RisetModel 🇺🇸 27.07.2026 10:05

FFASR Leaderboard Launched — a Benchmark for Evaluating ASR in Real Acoustic Conditions

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies and Hugging Face have launched the FFASR Leaderboard, the first open community benchmark for evaluating automatic speech recognition (ASR) systems in far-field conditions. The benchmark shows that at low signal-to-noise ratio (SNR), far-field recognition error rates are several times higher than in near-field. The platform enables evaluation of both accuracy (word error rate, WER) and speed (real-time factor, RTFx) of models.
Perusahaan Treble Technologies dan Hugging Face meluncurkan FFASR Leaderboard — tolok ukur terbuka pertama yang didukung komunitas untuk mengevaluasi model ASR dalam kondisi realistis medan jauh dengan lingkungan akustik yang kompleks: gema, kebisingan, dan jarak mikrofon. Tolok ukur ini menggunakan simulator hibrida Treble yang menggabungkan solver gelombang untuk frekuensi rendah dan menengah dengan akustik geometris untuk frekuensi tinggi, memungkinkan pemodelan fenomena fisik secara akurat di 14 ruangan berbeda dengan volume 20 hingga 470 m³. Evaluasi dilakukan terhadap sembilan kondisi, empat di antaranya membentuk peringkat utama, serta mencakup trek untuk validasi simulasi (Lab Measured dan Lab Simulated) dan versi beta dengan sumber suara bergerak. Untuk setiap pengiriman, dicatat Word Error Rate (WER) untuk sembilan kondisi dan RTFx (audiodetik per detik inferensi) pada GPU NVIDIA L4. Hasil dari semua model yang dikirim menunjukkan kesenjangan yang konsisten: WER di medan jauh dengan Signal-to-Noise Ratio (SNR) rendah beberapa kali lebih tinggi daripada di medan dekat, dan visualisasi Pareto front dengan jelas menunjukkan kompromi antara akurasi dan kecepatan. Tolok ukur ini mendukung arsitektur Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain, dan lainnya melalui Hub, dan untuk tumpukan yang kompleks, pengguna dapat membuat evaluator sendiri. Pengembang berencana menambahkan skenario dengan banyak pembicara, dukungan susunan mikrofon, dan peredaman gema.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru