研究モデル 🇺🇸 27.07.2026 10:05

FFASR Leaderboard Launched — a Benchmark for Evaluating ASR in Real Acoustic Conditions

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies and Hugging Face have launched the FFASR Leaderboard, the first open community benchmark for evaluating automatic speech recognition (ASR) systems in far-field conditions. The benchmark shows that at low signal-to-noise ratio (SNR), far-field recognition error rates are several times higher than in near-field. The platform enables evaluation of both accuracy (word error rate, WER) and speed (real-time factor, RTFx) of models.
Treble TechnologiesとHugging Faceは、遠距離場における実環境での自動音声認識モデル評価のための初のオープンかつコミュニティ維持型ベンチマーク「FFASR Leaderboard」を発表しました。このベンチマークは、残響、ノイズ、マイク距離の遠さといった音響的に複雑な環境を想定しています。Trebleのハイブリッドシミュレーターを採用し、低・中周波数帯域には波動ソルバー、高周波数帯域には幾何音響学を組み合わせることで、容積20~470立方メートルの14種類の部屋における物理現象を正確にモデル化します。評価は9つの条件で行われ、うち4つが主要ランキングを構成し、さらにシミュレーション検証用のトラック(Lab Measured、Lab Simulated)と、移動音源を扱うベータ版のトラックも含まれます。各提出に対して、9条件でのWard Error Rate (WER) と、NVIDIA L4 GPU上でのRTFx(推論1秒あたりの音声秒数)が記録されます。提出された全モデルの結果は一貫した乖離を示しており、低Signal-to-Noise Ratio環境での遠距離場WERは近距離場より数倍高く、Paretoフロンティアの可視化は精度と速度のトレードオフを明確に示しています。ベンチマークはWhisper、IBM Granite Speech、Cohere Transcribe、Wav2Vec2、HuBERT、SpeechBrainなどのアーキテクチャをHugging Face Hub経由でサポートし、複雑なスタック向けには独自の評価器を作成することも可能です。開発者は今後、複数話者シナリオ、マイクアレイ対応、エコーキャンセレーションの追加を計画しています。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース