TutkimusMallit 🇺🇸 27.07.2026 10:05

FFASR-johtotaulu lanseerattu — vertailuarvo ASR:n arviointiin todellisissa akustisissa olosuhteissa

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
Treble Technologies ja Hugging Face ovat lanseeranneet FFASR-johtotaulun, ensimmäisen avoimen yhteisön vertailuarvon automaattisen puheentunnistuksen (ASR) järjestelmien arviointiin kaukokenttäolosuhteissa. Vertailuarvo osoittaa, että matalalla signaali-kohinasuhteella (SNR) kaukokentän tunnistusvirheet ovat moninkertaisia lähikenttään verrattuna. Alusta mahdollistaa sekä tarkkuuden (sananvirhesuhde, WER) että nopeuden (reaaliaikakerroin, RTFx) arvioinnin malleille.
Treble Technologies ja Hugging Face ovat julkistaneet FFASR Leaderboardin – ensimmäisen avoimen ja yhteisön ylläpitämän vertailuympäristön, joka on suunniteltu arvioimaan automaattisen puheentunnistuksen (ASR) malleja realistisissa kaukokenttäolosuhteissa, joissa on akustisesti haastava ympäristö: jälkikaiuntaa, kohinaa ja mikrofonin etäisyyttä. Vertailuympäristö käyttää Treblen hybridisimulaattoria, joka yhdistää aaltoratkaisijan matalille ja keskitaajuuksille geometriseen akustiikkaan korkeilla taajuuksilla, mikä mahdollistaa fysikaalisten ilmiöiden tarkan mallintamisen 14 eri huoneessa, joiden tilavuus vaihtelee 20:stä 470:een kuutiometriin. Arviointi suoritetaan yhdeksällä ehdolla, joista neljä muodostaa pääarvosanan, ja se sisältää myös simulaation validointiin tarkoitetut osiot (Lab Measured ja Lab Simulated) sekä beetaversion liikkuvalla äänilähteellä. Jokaiselle lähetykselle tallennetaan Word Error Rate (WER) yhdeksälle ehdolle ja RTFx (äänisekuntia päättelysekuntia kohti) NVIDIA L4 -grafiikkasuorittimella. Kaikkien toimitettujen mallien tulokset osoittavat jatkuvan eron: kaukokentässä matalalla signaali-kohinasuhteella WER on moninkertainen lähikenttään verrattuna, ja Pareto-rintaman visualisointi havainnollistaa selkeästi tarkkuuden ja nopeuden välistä kompromissia. Vertailuympäristö tukee Whisper-, IBM Granite Speech-, Cohere Transcribe-, Wav2Vec2-, HuBERT-, SpeechBrain- ja muita arkkitehtuureja Hubin kautta, ja monimutkaisille pinoille voidaan luoda oma arvioija. Kehittäjät suunnittelevat lisäävänsä skenaarioita, joissa on useita puhujia, mikrofoniryhmien tuen ja kaiunpoiston.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset