Lancement du classement FFASR — un benchmark pour évaluer la reconnaissance vocale en conditions acoustiques réelles
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Treble Technologies et Hugging Face ont lancé le classement FFASR, le premier benchmark communautaire ouvert pour évaluer les systèmes de reconnaissance automatique de la parole (ASR) en conditions de champ lointain. Le benchmark montre qu'à faible rapport signal sur bruit (SNR), les taux d'erreur de reconnaissance en champ lointain sont plusieurs fois supérieurs à ceux en champ proche. La plateforme permet d'évaluer à la fois la précision (taux d'erreur de mots, WER) et la vitesse (facteur temps réel, RTFx) des modèles.
Treble Technologies et Hugging Face ont dévoilé le FFASR Leaderboard, le premier benchmark ouvert et soutenu par la communauté pour évaluer les modèles de Reconnaissance Automatique de la Parole (ASR) dans des conditions réalistes de champ lointain, avec un environnement acoustiquement complexe : réverbération, bruits et éloignement du microphone. Le benchmark utilise le simulateur hybride de Treble, qui combine un solveur ondulatoire pour les basses et moyennes fréquences avec une acoustique géométrique pour les hautes fréquences, permettant de modéliser avec précision les phénomènes physiques dans 14 pièces différentes, dont le volume varie de 20 à 470 m³. L'évaluation est réalisée selon neuf conditions, dont quatre forment le classement principal, et inclut également des pistes pour la validation de la simulation (Lab Measured et Lab Simulated) ainsi qu'une version bêta avec une source sonore en mouvement. Pour chaque soumission, le taux d'erreur lexicale (WER, pour Word Error Rate) est mesuré pour les neuf conditions, ainsi que le RTFx (secondes audio par seconde d'inférence) sur une GPU NVIDIA L4. Les résultats de tous les modèles soumis montrent un écart persistant : le WER en champ lointain avec un faible rapport signal sur bruit (SNR) est plusieurs fois supérieur à celui en champ proche, et la visualisation du front de Pareto illustre clairement le compromis entre précision et vitesse. Le benchmark prend en charge les architectures Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain et d'autres via le Hub, et pour les piles logicielles complexes, il est possible de créer son propre évaluateur. Les développeurs prévoient d'ajouter des scénarios avec plusieurs locuteurs, la prise en charge des réseaux de microphones et la suppression d'écho.
Source: Hugging Face blog —
original
