研究メディア生成 🇺🇸 27.07.2026 02:04

Real World VoiceEQ 発表:音声AI品質評価の新ベンチマーク

Hume AIHume AI
Hume AI が Real World VoiceEQ を発表。人間品質の音声対話を評価するベンチマークで、100万以上の人間による評価に基づき、40以上のモデルを60以上の指標で評価。ASR(自動音声認識)、TTS(テキスト読み上げ)、S2S(音声間変換)、音声理解を含む。ベンチマークの結果、全カテゴリで優れたモデルは存在せず、現在のシステムは感情や文脈認識に弱点があることが明らかになった。
Hume AI のチームは、人間の視点から音声 AI の品質を評価するために設計された Real World VoiceEQ ベンチマークを発表しました。このベンチマークは、自動音声認識(ASR)、テキスト音声合成(TTS)、音声音声変換(S2S)、音声理解をカバーする15以上の主要指標と60以上のメトリクスに基づいて、40以上の主要なプロプライエタリおよびオープンソースの音声 AI モデルを評価します。このベンチマークは、多様な人口統計グループ、発話スタイル、音響環境にわたって収集された100万以上の個別の人間による評価に基づいています。現在のバージョンには78万5000件の TTS 評価と4万8000件の S2S 評価が含まれており、音声 AI 品質に関する最大規模の人間参加型研究の1つとなっています。評価は Kairos プラットフォーム上で実施されました。結果によると、8つの能力グループすべてで上位5位以内に入る単一のシステムは存在せず、単一の「最高の」音声モデルはないことが浮き彫りになりました。音声音声変換モデルは最大のばらつきを示し、一部は感情認識に優れていても自然な応答ができませんでした。オーディオにアクセスできることは、エージェントがパラ言語情報を使用することを保証せず、多くのシステムは依然として文字起こしに依存し、トーン、ポーズ、ためらい、イントネーション、音量を無視していることが判明しました。また、ベンチマークでは、アクセントのある音声、重なり合う音声、感情、背景ノイズ、長い対話においてモデルのパフォーマンスが低下することも明らかになりました。ノイズの多い音声の単語誤り率は、音楽背景の約4倍でした。さらに、一部のモデルは標準ベンチマークに最適化されているようで、参照トランスクリプトから既知のエラーを再現していることが示されました。主要な音声言語モデル(SLM)と訓練された人間評価者との比較では、明確な正解があるタスクでは一致率が最も高いが、主観的な評価(例えば、声を演技役に合わせる、アイデンティティを保持するなど)では低下することが分かりました。自動評価者は、判断が音響コンテキストと社会的解釈に依存する場合、まだ人間を代替できていません。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース