Hume представила Real World VoiceEQ — бенчмарк для оценки качества голосового ИИ с точки зрения человека

Hugging FaceHugging Face Hume AIHume AI
Компания Hume выпустила бенчмарк Real World VoiceEQ, оценивающий более 40 голосовых моделей по 15+ измерениям и 60+ метрикам на основе более 1 миллиона человеческих оценок. Бенчмарк выявил, что лучшие модели оптимизированы под разные способности, а модели Speech-to-Speech демонстрируют наибольшую вариативность, при этом некоторые системы игнорируют паралингвистическую информацию (тон, паузы, громкость).
Компания Hume представила бенчмарк Real World VoiceEQ для оценки человеческого качества голосового взаимодействия. Бенчмарк оценивает более 40 ведущих проприетарных и открытых голосовых моделей по 15+ ключевым измерениям и более 60 метрикам, охватывающим автоматическое распознавание речи (ASR), синтез речи из текста (TTS), преобразование речи в речь (S2S) и понимание речи. Real World VoiceEQ основан на более чем 1 миллионе индивидуальных человеческих оценок, собранных от разных демографических групп, стилей речи и акустических сред. Текущая версия включает 785 000 оценок TTS и 48 000 оценок STS, что делает его одним из крупнейших исследований человеческого восприятия голосового ИИ. Все оценки проводились с использованием платформы Kairos, созданной Hume. Результаты показали, что не существует единой «лучшей» голосовой модели: разные системы оптимизированы под разные способности — техническую точность, эмоциональное понимание, разговорный интеллект, выразительность и робастность. Наибольший разброс показали модели Speech-to-Speech: некоторые из них хорошо распознавали эмоции, но не могли естественно реагировать. Многие модели остаются в значительной степени основанными на транскрипции, игнорируя такие паралингвистические сигналы, как тон, темп, колебания, ударения и громкость. Бенчмарк также выявил, что существующие бенчмарки приближаются к насыщению и не отражают реальные условия, например частоту ошибок при распознавании речи на фоне шума, которая оказалась примерно в четыре раза выше, чем на фоне музыки. Кроме того, Hume обнаружила признаки того, что некоторые модели оптимизированы под известные публичные бенчмарки, воспроизводя известные ошибки в эталонных транскрипциях. Сравнение ведущих языковых моделей речи (SLMs) с обученными людьми-оценщиками показало, что согласие SLMs с людьми выше на задачах с чёткими, проверяемыми ответами (например, точность произношения), но снижается на более субъективных оценках, таких как соответствие голоса актёрской роли. Поэтому автоматические оценщики не могут пока заменить людей в суждениях, зависящих от акустического контекста, восприятия и социальной интерпретации.
Сокращения
ASR = Automatic Speech Recognition — автоматическое распознавание речи
TTS = Text-to-Speech — синтез речи из текста
S2S = Speech-to-Speech — преобразование речи в речь
STS = Speech-to-Speech — преобразование речи в речь
SLM = Speech-Language Model — речевая языковая модель
Источник: Hugging Face blog — оригинал

Наши прошлые публикации по теме

Есть свежие новости