RisetModel 🇺🇸 27.07.2026 10:05

Papan Peringkat FFASR Diluncurkan: Tolok Ukur untuk Mengevaluasi ASR dalam Kondisi Akustik Nyata

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Hugging Face dan Treble Technologies telah meluncurkan Papan Peringkat Far-Field ASR (FFASR), tolok ukur terbuka pertama yang didorong komunitas untuk mengevaluasi model ASR dalam kondisi lapangan jauh yang realistis seperti gaung, kebisingan latar, dan jarak mikrofon. Hasil awal menunjukkan bahwa WER lapangan jauh pada SNR rendah beberapa kali lebih tinggi daripada WER lapangan dekat, menyoroti kesenjangan signifikan antara kinerja tolok ukur dan penerapan di dunia nyata.
Papan Peringkat FFASR, yang dibuat oleh Hugging Face dan Treble Technologies, adalah tolok ukur terbuka pertama yang digerakkan oleh komunitas untuk mengevaluasi model-model Automatic Speech Recognition (ASR) dalam kondisi akustik jarak jauh yang realistis. Tolok ukur ini mengatasi kesenjangan yang terus-menerus terjadi antara kinerja dalam tolok ukur dan penerapan di dunia nyata, di mana model yang mendapat skor baik pada tolok ukur jarak dekat standar sering kali menurun secara signifikan akibat gaung, kebisingan latar belakang, dan jarak mikrofon. Papan peringkat ini mengevaluasi model dalam sembilan kondisi, dengan empat di antaranya menentukan skor peringkat utama. Data akustik dihasilkan menggunakan mesin simulasi hibrida Treble, yang menggabungkan pemodelan berbasis gelombang dan akustik geometris untuk menangkap fenomena seperti difraksi dan interferensi. Empat belas ruangan yang dilengkapi perabotan lengkap disertakan, mulai dari 20 hingga 470 m³. Selain Word Error Rate (WER), papan peringkat ini juga melaporkan RTFx (detik audio per detik inferensi) untuk setiap pengiriman, yang dievaluasi pada GPU NVIDIA L4. Hasil awal menunjukkan bahwa WER jarak jauh pada Signal-to-Noise Ratio (SNR) rendah beberapa kali lebih tinggi daripada WER jarak dekat. Papan peringkat ini mendukung varian Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain, dan sebagian besar arsitektur ASR lainnya melalui pengiriman ID model di Hugging Face. Opsi evaluator kustom memungkinkan tumpukan inferensi yang lebih kompleks. Rencana ke depan mencakup skenario multi-pembicara, evaluasi susunan mikrofon, dan pembatalan gema.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru