FFASR排行榜发布——真实声学条件下评估语音识别的新基准
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Treble Technologies与Hugging Face联合发布了FFASR排行榜,这是首个在远场条件下评估自动语音识别(ASR)系统的开放社区基准。该基准表明,在低信噪比(SNR)下,远场识别错误率比近场高出数倍。该平台支持评估模型的准确性(词错误率,WER)和速度(实时因子,RTFx)。
Treble Technologies 与 Hugging Face 联合推出了 FFASR Leaderboard,这是首个由社区驱动的开源基准测试,用于在具有声学复杂性的真实远场环境中评估 ASR 模型,这些环境包括混响、噪声和麦克风距离。该基准测试采用 Treble 混合模拟器,该模拟器结合了低频和中频的波动求解器与高频的几何声学,从而能够在 20 至 470 立方米的 14 个不同房间中精确模拟物理现象。评估涵盖九种条件,其中四种构成主要排名,此外还包括仿真验证轨道(实验室测量和实验室模拟)以及移动声源的测试版。每次提交都会记录九种条件下的词错误率 (WER) 以及在 NVIDIA L4 GPU 上的 RTFx(每秒推理处理的音频秒数)。所有提交模型的结果均显示出持续差距:低信噪比远场条件下的 WER 比近场条件下高出数倍,而帕累托前沿的可视化则清晰展示了准确性与速度之间的权衡。该基准测试通过 Hugging Face Hub 支持 Whisper、IBM Granite Speech、Cohere Transcribe、Wav2Vec2、HuBERT、SpeechBrain 等架构,对于复杂堆叠,用户可创建自定义评估器。开发者计划增加多说话人场景、麦克风阵列支持和回声消除功能。
来源: Hugging Face blog —
原文
