FFASR-lista käynnistetty: Vertailulauta ASR:n arviointiin todellisissa akustisissa olosuhteissa
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Hugging Face ja Treble Technologies ovat julkaisseet Far-Field ASR (FFASR) -vertailulistan, ensimmäisen avoimen yhteisön ylläpitämän vertailun ASR-mallien arviointiin realistisissa kaukokenttäolosuhteissa, kuten jälkikaiunta, taustamelu ja mikrofonin etäisyys. Alustavat tulokset osoittavat, että kaukokentän WER matalalla signaali-kohinasuhteella on useita kertoja korkeampi kuin lähikentän WER, mikä korostaa merkittävää eroa vertailusuorituskyvyn ja todellisen käyttöönoton välillä.
Hugging Facen ja Treble Technologiesin luoma FFASR-johtotaulu on ensimmäinen avoin yhteisövetoinen vertailu, joka arvioi ASR-malleja realistisissa kaukokentän akustisissa olosuhteissa. Se pyrkii ratkaisemaan jatkuvan kuilun vertailuarvojen ja todellisen käyttöönoton välillä, sillä malleilla, jotka menestyvät hyvin tavallisissa lähikenttävertailuissa, suorituskyky heikkenee usein merkittävästi jälkikaiunnan, taustamelun ja mikrofonietäisyyden vaikutuksesta. Johtotaulussa malleja arvioidaan yhdeksässä eri olosuhteessa, joista neljä määrää ensisijaisen sijoituspisteen. Akustinen data tuotetaan Treblen hybridisimulaatiomoottorilla, joka yhdistää aaltopohjaisen ja geometrisen akustiikan mallinnuksen ja kykenee kuvaamaan ilmiöitä, kuten diffraktiota ja interferenssiä. Mukana on neljätoista täysin kalustettua huonetta, joiden koko vaihtelee 20:stä 470:een kuutiometriin. Sanojen virhetason (WER, Word Error Rate) ohella johtotaulu raportoi RTFx-arvon (audiosekuntia inferenssisekuntia kohti) jokaisesta lähetyksestä, ja se arvioidaan NVIDIA L4 -grafiikkasuorittimella. Alustavat tulokset osoittavat, että kaukokentän WER matalalla signaali-kohinasuhteella on moninkertainen lähikentän WERiin verrattuna. Johtotaulu tukee Whisper-muunnelmia, IBM Granite Speechia, Cohere Transcribea, Wav2Vec2:ta, HuBERTia, SpeechBrainia ja useimpia muita ASR-arkkitehtuureja Hugging Face -mallitunnuksen kautta. Räätälöidyn evaluoijan avulla voidaan käyttää monimutkaisempia inferenssipinoja. Tulevaisuuden suunnitelmiin kuuluvat usean puhujan skenaariot, mikrofoniryhmien arviointi ja kaikunpoisto.
Lähde: Hugging Face blog —
Alkuperäinen
