연구모델 🇺🇸 27.07.2026 10:05

FFASR Leaderboard Launched — a Benchmark for Evaluating ASR in Real Acoustic Conditions

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies and Hugging Face have launched the FFASR Leaderboard, the first open community benchmark for evaluating automatic speech recognition (ASR) systems in far-field conditions. The benchmark shows that at low signal-to-noise ratio (SNR), far-field recognition error rates are several times higher than in near-field. The platform enables evaluation of both accuracy (word error rate, WER) and speed (real-time factor, RTFx) of models.
Treble Technologies와 Hugging Face가 FFASR Leaderboard를 공개했습니다. 이는 잔향, 잡음 및 마이크 거리 등 음향적으로 복잡한 원거리 필드 현실 환경에서 자동 음성 인식 모델을 평가하기 위한 최초의 오픈 소스 커뮤니티 기반 벤치마크입니다. 이 벤치마크는 Treble의 하이브리드 시뮬레이터를 사용하는데, 저주파 및 중간 주파수에는 파동 해석기를, 고주파수에는 기하 음향을 결합하여 20m³에서 470m³까지 총 14개의 다양한 공간에서 물리적 현상을 정확히 모델링합니다. 평가는 9가지 조건으로 수행되며, 그중 4가지가 주요 순위를 구성합니다. 또한 시뮬레이션 검증을 위한 Lab Measured 및 Lab Simulated 트랙과 이동 음원을 포함한 베타 버전도 제공됩니다. 각 제출물에 대해 9가지 조건의 Word Error Rate와 NVIDIA L4 GPU에서의 RTFx(추론 시간당 오디오 초)가 기록됩니다. 제출된 모든 모델의 결과는 지속적인 격차를 보여주는데, 낮은 신호 대 잡음비에서 원거리 필드의 WER이 근거리 필드보다 몇 배 높으며, 파레토 프런트 시각화는 정확성과 속도 간의 트레이드오프를 명확히 보여줍니다. 이 벤치마크는 Hub를 통해 Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain 등의 아키텍처를 지원하며, 복잡한 스택의 경우 사용자 정의 평가자를 만들 수 있습니다. 개발자들은 향후 다중 화자 시나리오, 마이크 어레이 지원 및 에코 제거 기능을 추가할 계획입니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스