Nghiên cứuMô hình 🇺🇸 27.07.2026 10:05

FFASR Leaderboard Launched — a Benchmark for Evaluating ASR in Real Acoustic Conditions

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies and Hugging Face have launched the FFASR Leaderboard, the first open community benchmark for evaluating automatic speech recognition (ASR) systems in far-field conditions. The benchmark shows that at low signal-to-noise ratio (SNR), far-field recognition error rates are several times higher than in near-field. The platform enables evaluation of both accuracy (word error rate, WER) and speed (real-time factor, RTFx) of models.
Компании Treble Technologies и Hugging Face представили FFASR Leaderboard — первый открытый и поддерживаемый сообществом бенчмарк для оценки моделей автоматического распознавания речи в реалистичных условиях дальнего поля с акустически сложной средой: реверберацией, шумами и удалённостью микрофона. Бенчмарк использует гибридный симулятор Treble, сочетающий волновой решатель для низких и средних частот с геометрической акустикой для высоких частот, что позволяет точно моделировать физические явления в 14 различных помещениях объёмом от 20 до 470 м³. Оценка проводится по девяти условиям, четыре из которых формируют основной рейтинг, а также включает треки для валидации симуляции (Lab Measured и Lab Simulated) и бета-версию с движущимся источником звука. Для каждого сабмита фиксируются показатель Word Error Rate (WER) для девяти условий и RTFx (аудиосекунд на секунду инференса) на GPU NVIDIA L4. Результаты всех поданных моделей показывают устойчивый разрыв: WER в дальнем поле при низком SNR в несколько раз выше, чем в ближнем, а визуализация Парето-фронта наглядно демонстрирует компромисс между точностью и скоростью. Бенчмарк поддерживает архитектуры Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain и другие через Hub, а для сложных стеков можно создать свой оценщик. Разработчики планируют добавить сценарии с несколькими говорящими, поддержку микрофонных решёток и эхоподавление.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới