Запущен FFASR Leaderboard: новый бенчмарк для оценки ASR в реальных акустических условиях

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Компании Treble Technologies и Hugging Face представили FFASR Leaderboard — первый открытый бенчмарк для оценки моделей автоматического распознавания речи (ASR) в условиях дальнего поля. Тестирование показало, что показатель WER в дальней зоне при низком SNR в несколько раз выше, чем в ближней зоне, что подтверждает разрыв между лабораторными показателями и реальным развёртыванием.
Treble Technologies и Hugging Face запустили Far-Field ASR (FFASR) Leaderboard — первый открытый, управляемый сообществом бенчмарк, предназначенный для оценки ASR-моделей в реалистичных акустических условиях дальнего поля. Бенчмарк оценивает модели по девяти сценариям, из которых четыре определяют основной рейтинг. Голосовые интерфейсы активно внедряются в акустически сложные среды: AI-агенты, транскрипция конференц-залов, автомобильные ассистенты, человекоподобные роботы, умные очки. Существующие бенчмарки (LibriSpeech и другие) не отражают такие условия. FFASR использует гибридный симуляционный движок Treble, сочетающий волновое моделирование на низких/средних частотах с геометрической акустикой на высоких, что позволяет реалистично симулировать реверберацию, шумы и помехи. Набор данных включает 14 меблированных комнат объёмом от 20 до 470 м³ (ванные, гостиные, офисы, классы, рестораны). В каждой сцене один целевой диктор и до трёх источников шума (кашель, HVAC и т.д.) на трёх уровнях SNR. Для всех заявок измеряется RTFx на GPU NVIDIA L4, а график Парето отображает компромисс между точностью и скоростью. Предварительные результаты показывают, что WER в дальней зоне при низком SNR в несколько раз выше, чем на чистых ближнепольных данных. Бенчмарк поддерживает множество архитектур: Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain и другие — без дополнительной настройки. Для сложных пайплайнов есть возможность создания собственного оценщика. В планах — добавление многоспикерных сценариев, поддержка микрофонных решёток и эхоподавление.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
WER = Word Error Rate — частота ошибок в словах
SNR = Signal-to-Noise Ratio — отношение сигнал/шум
RTFx = Real-Time Factor — коэффициент реального времени (отношение времени обработки к длительности аудио)
GPU = Graphics Processing Unit — графический процессор
CTC = Connectionist Temporal Classification — коннекционистская темпоральная классификация
Источник: Hugging Face blog — оригинал

Наши прошлые публикации по теме

Есть свежие новости