RechercheModèles 🇺🇸 27.07.2026 10:05

Lancement du classement FFASR : un benchmark pour évaluer la reconnaissance vocale dans des conditions acoustiques réelles

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Hugging Face et Treble Technologies ont lancé le classement Far-Field ASR (FFASR), le premier benchmark communautaire ouvert pour évaluer les modèles de reconnaissance automatique de la parole dans des conditions réalistes de champ lointain, telles que la réverbération, le bruit de fond et la distance du microphone. Les premiers résultats montrent que le taux d'erreur de mots (WER) en champ lointain à faible rapport signal sur bruit est plusieurs fois supérieur au WER en champ proche, soulignant un écart significatif entre les performances des benchmarks et le déploiement dans le monde réel.
Le classement FFASR, créé par Hugging Face et Treble Technologies, est le premier benchmark ouvert piloté par la communauté pour évaluer les modèles de reconnaissance automatique de la parole (ASR) dans des conditions acoustiques réalistes en champ lointain. Il comble le fossé persistant entre les performances sur des benchmarks et le déploiement réel, où les modèles obtenant de bons résultats sur des benchmarks standard en champ proche se dégradent souvent considérablement en présence de réverbération, de bruit ambiant et de distance du microphone. Le classement évalue les modèles dans neuf conditions, dont quatre déterminent le score principal. Les données acoustiques sont générées à l'aide du moteur de simulation hybride de Treble, combinant modélisation par ondes et acoustique géométrique pour capturer des phénomènes tels que la diffraction et les interférences. Quatorze pièces entièrement meublées sont incluses, allant de 20 à 470 m³. En plus du taux d'erreur lexicale (WER), le classement rapporte le RTFx (secondes audio par seconde d'inférence) pour chaque soumission, évalué sur un GPU NVIDIA L4. Les résultats initiaux montrent que le WER en champ lointain à faible rapport signal sur bruit (SNR) est plusieurs fois supérieur au WER en champ proche. Le classement prend en charge les variantes de Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain et la plupart des autres architectures ASR via une soumission d'identifiant de modèle Hugging Face. Une option d'évaluateur personnalisé permet des piles d'inférence plus complexes. Les projets futurs incluent des scénarios à plusieurs locuteurs, l'évaluation de réseaux de microphones et l'annulation d'écho.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches