в речь (S2S) и понимание речи. Бенчмарк основан на более чем 1 миллионе индивидуальных человеческих оценок, собранных среди разнообразных демографических групп, стилей речи и акустических сред. Текущая версия включает 785 000 оценок TTS и 48 000 оценок S2S, что делает его одним из крупнейших исследований качества голосового ИИ с участием человека. Оценки проводились на платформе Kairos. Согласно результатам, ни одна система не входит в первую пятерку по всем восьми группам способностей, что подчеркивает отсутствие единой «лучшей» голосовой модели. Модели «речь-в-речь» показали наибольшую вариативность: некоторые хорошо распознавали эмоции, но не могли естественно отвечать. Оказалось, что доступ к аудио не гарантирует, что агенты используют паралингвистическую информацию — многие системы остаются зависимы от транскриптов, игнорируя тон, паузы, нерешительность, интонацию и громкость. Бенчмарк также выявил, что модели хуже работают с акцентированной речью, накладывающимися голосами, эмоциями, фоновым шумом и длинными диалогами. Частота ошибок при распознавании слов в зашумленной речи была примерно в четыре раза выше, чем при фоновой музыке. Кроме того, некоторые модели, по-видимому, оптимизированы под стандартные бенчмарки, воспроизводя известные ошибки из эталонных транскриптов. Сравнение ведущих языковых моделей речи (SLM) с обученными людьми-оценщиками показало, что согласованность выше всего на задачах с четкими правильными ответами, но снижается на субъективных оценках — например, при подборе голоса к актерской роли или сохранении идентичности. Автоматизированные оценщики пока не способны заменить людей, когда суждение зависит от акустического контекста и социальной интерпретации.