研究媒体生成 🇺🇸 27.07.2026 02:04

Real World VoiceEQ 发布:评估语音 AI 质量的新基准

Hume AIHume AI
Hume AI 推出 Real World VoiceEQ,这是一个评估人类级语音交互质量的基准。基于超过一百万个人类评分,它涵盖了 40 多个模型在 60 多项指标上的表现,包括自动语音识别、文本转语音、语音到语音以及语音理解。该基准揭示,没有单一模型在所有类别中都表现出色,并突显了当前系统在情感和上下文识别方面的弱点。
Hume AI 团队推出了真实世界语音 EQ 基准测试,旨在从人类视角评估语音人工智能的质量。该基准在 15 多个关键维度和 60 多项指标上评估了超过 40 个领先的专有和开源语音 AI 模型,涵盖自动语音识别、文本转语音、语音到语音和语音理解。该基准基于超过 100 万个人类个体评估,这些评估收集自不同的人口统计群体、语音风格和声学环境。当前版本包括 785,000 次 TTS 评估和 48,000 次 S2S 评估,是语音 AI 质量领域中规模最大的人机交互研究之一。评估在 Kairos 平台上进行。根据结果,没有任何一个系统在所有八个能力组中均排名前五,这表明不存在单一的“最佳”语音模型。语音到语音模型显示出最大的差异:有些模型在识别情感方面表现良好,但无法自然回应。事实证明,访问音频并不能保证智能体利用副语言信息——许多系统仍然依赖转录文本,忽略了语调、停顿、犹豫、语调和音量。该基准还揭示,模型在面对带口音的语言、重叠语音、情感、背景噪音和长对话时表现更差。噪音语音的词错误率大约是音乐背景下的四倍。此外,一些模型似乎为标准化基准进行了优化,重复了参考转录文本中的已知错误。对比领先的语音语言模型与训练有素的人类评估者发现,在具有明确正确答案的任务上一致性最高,但在主观评估(例如,将语音匹配到角色或保持身份一致性)上一致性下降。当判断依赖于声学背景和社会解释时,自动化评估器尚无法取代人类。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻