模型研究 🇷🇺 06.08.2026 07:03

23款ASR模型俄语IT听写基准测试:我三月的推荐已过时

OpenAIOpenAI
一位开发者重新评估了用于俄语IT听写的语音转文字模型,测试了23款自动语音识别(ASR)模型,采用60多种配置,进行了10万次运行。他们发现意外之选Breeze ASR在性能上匹敌甚至超越了Whisper Large v3,因此更新了推荐。该基准测试引入了综合指标Q,该指标结合了词错率(WER)、标点准确度,以及新的英文保留指数(EPI),以奖励那些将英文术语保留为拉丁字母书写的模型。
三月,作者曾推荐Whisper Large v3用于俄语IT听写,但后来发现了Breeze ASR,一个针对台湾普通话并支持语码转换的优化模型,其表现至少相当。为了验证,他们构建了一个严格的基准测试:23个模型,超过60种配置,在俄英IT语料库上进行了超过10万次运行,使用RTX 5070 Ti进行了超过120小时的推理。语料库包括两位发言人(作者及其妻子)朗读的长篇文本,其中包含不同密度的英语IT术语。综合指标Q(0.65 WER + 0.10标点 + 0.25 EPI)平衡了词准确率、标点质量和英文术语以拉丁字母保留的情况。WER被归一化,不惩罚音译,而EPI则奖励规范英文形式,并对不完美的拉丁字母保留给予部分认可。结果显示,Breeze ASR在该基准测试中优于Whisper Large v3,使得三月的推荐已过时。作者还测试了多种标点提示,发现自定义提示能显著改善标点。交互式基准测试页面允许调整权重,以适应不同的听写场景。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻