FFASR 리더보드 출시: 실제 음향 환경에서의 ASR 평가를 위한 벤치마크
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Hugging Face와 Treble Technologies가 FFASR(Far-Field ASR) 리더보드를 출시했습니다. 이는 잔향, 배경 소음, 마이크 거리 등 현실적인 원거리 환경에서 ASR 모델을 평가하기 위한 최초의 오픈 커뮤니티 기반 벤치마크입니다. 초기 결과는 저신호대잡음비(SNR)에서의 원거리 단어 오류율(WER)이 근거리 WER보다 몇 배 높은 것으로 나타나, 벤치마크 성능과 실제 배포 간의 상당한 차이를 드러냈습니다.
Hugging Face와 Treble Technologies가 공동으로 만든 FFASR 리더보드는 실제 원거리 음향 조건에서 ASR 모델을 평가하기 위한 최초의 오픈 커뮤니티 기반 벤치마크입니다. 이 리더보드는 벤치마크 성능과 실제 배포 간의 지속적인 격차를 해소합니다. 표준 근거리 벤치마크에서 좋은 점수를 받은 모델도 잔향, 배경 소음, 마이크 거리 등이 있는 환경에서 성능이 크게 저하되는 경우가 많기 때문입니다. 리더보드는 9가지 조건에서 모델을 평가하며, 그중 4가지 조건이 기본 순위 점수를 결정합니다. 음향 데이터는 Treble의 하이브리드 시뮬레이션 엔진을 사용하여 생성되며, 파동 기반 모델링과 기하 음향 모델링을 결합하여 회절 및 간섭과 같은 현상을 포착합니다. 20m³에서 470m³에 이르는 14개의 완전히 가구가 갖춰진 방이 포함됩니다. WER(단어 오류율)과 함께 리더보드는 NVIDIA L4 GPU에서 평가된 모든 제출물에 대한 RTFx(추론 초당 오디오 초)를 보고합니다. 초기 결과에 따르면 낮은 SNR(신호 대 잡음비)에서의 원거리 WER은 근거리 WER보다 몇 배 더 높습니다. 리더보드는 Whisper 변형, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain 및 대부분의 다른 ASR 아키텍처를 Hugging Face 모델 ID 제출을 통해 지원합니다. 사용자 정의 평가기 옵션을 통해 더 복잡한 추론 스택을 사용할 수 있습니다. 향후 계획으로는 다중 화자 시나리오, 마이크 어레이 평가, 에코 제거 등이 포함됩니다.
출처: Hugging Face blog —
원문
