акустикой для высоких частот, что позволяет точно моделировать физические явления в 14 различных помещениях объёмом от 20 до 470 м³. Оценка проводится по девяти условиям, четыре из которых формируют основной рейтинг, а также включает треки для валидации симуляции (Lab Measured и Lab Simulated) и бета-версию с движущимся источником звука. Для каждого сабмита фиксируется Word Error Rate (WER) для девяти условий и RTFx (аудиосекунд на секунду инференса) на NVIDIA L4 GPU. Результаты всех поданных моделей показывают устойчивый разрыв: WER в дальнем поле при низком SNR в несколько раз выше, чем в ближнем, а визуализация Парето-фронта наглядно демонстрирует компромисс между точностью и скоростью. Бенчмарк поддерживает архитектуры Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain и другие через Hub, а для сложных стеков можно создать свой оценщик. Разработчики планируют добавить сценарии с несколькими говорящими, поддержку микрофонных решёток и эхоподавление.