Запущен FFASR Leaderboard — бенчмарк для оценки ASR в реальных акустических условиях
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Компании Treble Technologies и Hugging Face запустили FFASR Leaderboard — первый открытый сообщественный бенчмарк для оценки систем автоматического распознавания речи (ASR) в условиях дальнего поля. Бенчмарк показывает, что при низком SNR (соотношении сигнал-шум) ошибка распознавания в дальнем поле в несколько раз выше, чем в ближнем. Платформа позволяет оценить как точность (WER), так и скорость (RTFx) моделей.
Компании Treble Technologies и Hugging Face представили FFASR Leaderboard — первый открытый и поддерживаемый сообществом бенчмарк для оценки моделей ASR в реалистичных условиях дальнего поля с акустически сложной средой: реверберацией, шумами и удалённостью микрофона. Бенчмарк использует гибридный симулятор Treble, сочетающий волновой решатель для низких и средних частот с геометрической
Показать ещё ↓
- Сокращения
- ASR = Automatic Speech Recognition — автоматическое распознавание речи
- SNR = Signal-to-Noise Ratio — соотношение сигнал-шум
- WER = Word Error Rate — частота ошибок в словах
- RTFx = Real-Time Factor — фактор реального времени (аудиосекунд на секунду инференса)
- RIR = Room Impulse Response — импульсная характеристика помещения
- CTC = Connectionist Temporal Classification — коннекционистская временная классификация
- GPU = Graphics Processing Unit — графический процессор
- HVAC = Heating, Ventilation, and Air Conditioning — система отопления, вентиляции и кондиционирования
Источник: Hugging Face blog —
оригинал
