FFASR排行榜发布:真实声学环境下的ASR评测基准
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Hugging Face 与 Treble Technologies 联合推出了远场语音识别(Far-Field ASR, FFASR)排行榜,这是首个面向真实远场条件(如混响、背景噪声、麦克风距离)的开放社区驱动ASR模型评测基准。初步结果显示,低信噪比下的远场词错误率(Word Error Rate, WER)是近场WER的数倍,凸显了基准性能与实际部署之间的显著差距。
由Hugging Face和Treble Technologies共同创建的FFASR排行榜,是首个用于在真实远场声学条件下评估自动语音识别(ASR)模型的开源社区驱动基准。它解决了基准测试性能与实际部署之间长期存在的差距——那些在标准近场基准上得分较高的模型,在混响、背景噪声和麦克风距离等条件下往往性能显著下降。该排行榜在九种条件下评估模型,其中四种条件决定主要排名分数。声学数据使用Treble的混合仿真引擎生成,该引擎结合了基于波动和几何声学的建模方法,以捕捉衍射和干涉等现象。排行榜包含14个完全装修的房间,面积从20到470立方米不等。除了词错误率(WER),排行榜还报告每次提交的实时因子(RTFx,即每秒音频的推理秒数),并在NVIDIA L4 GPU上进行评估。初步结果显示,在低信噪比(SNR)下,远场WER比近场WER高出数倍。该排行榜支持Whisper系列、IBM Granite Speech、Cohere Transcribe、Wav2Vec2、HuBERT、SpeechBrain以及大多数其他ASR架构,通过Hugging Face模型ID进行提交。自定义评估器选项允许更复杂的推理栈。未来计划包括多说话人场景、麦克风阵列评估和回声消除。
来源: Hugging Face blog —
原文
