Benchmark van 23 ASR-modellen voor Russische IT-dictatie: mijn aanbeveling van maart is verouderd
OpenAI
Een ontwikkelaar heeft spraak-naar-tekstmodellen opnieuw geëvalueerd voor Russische IT-dictatie, waarbij 23 ASR-modellen in meer dan 60 configuraties werden getest met 100.000 runs. Ze ontdekten dat Breeze ASR, een onverwachte vondst, Whisper Large v3 evenaart of overtreft, wat leidt tot een bijgewerkte aanbeveling. De benchmark introduceert een samengestelde metriek Q, die WER, leesteken-nauwkeurigheid en een nieuwe English Preservation Index (EPI) combineert om modellen te belonen die Engelse termen in Latijns schrift houden.
In maart raadde de auteur Whisper Large v3 aan voor Russische IT-dictatie, maar ontdekte later Breeze ASR, een model geoptimaliseerd voor Taiwanees-Mandarijn met ondersteuning voor code-mixing, dat minstens even goed presteerde. Om dit te verifiëren, bouwden ze een rigoureuze benchmark: 23 modellen in meer dan 60 configuraties, meer dan 100.000 runs op een Russisch-Engelse IT-corpus, met gebruik van meer dan 120 uur aan inferentie op een RTX 5070 Ti. Het corpus bevat twee sprekers (de auteur en zijn vrouw) die lange teksten voorlezen met wisselende dichtheden van Engelse IT-termen. De samengestelde metriek Q (0,65 WER + 0,10 interpunctie + 0,25 EPI) weegt woordnauwkeurigheid, interpunctiekwaliteit en behoud van Engelse termen in Latijns schrift. WER is genormaliseerd om transliteraties niet te bestraffen, terwijl EPI canonieke Engelse vormen beloont en gedeeltelijk krediet geeft aan onvolmaakt Latijns behoud. De resultaten tonen aan dat Breeze ASR beter presteert dan Whisper Large v3 op deze benchmark, waardoor de aanbeveling van maart verouderd is. De auteur testte ook meerdere interpunctie-prompts en ontdekte dat een aangepaste prompt de interpunctie aanzienlijk verbetert. De interactieve benchmarkpagina maakt het mogelijk om gewichten aan te passen aan verschillende dictatiescenario's.
Bron: Habr — хаб ML —
origineel
