Real World VoiceEQ Presentado: Un Nuevo Referente para Evaluar la Calidad de la Voz AI
Hume AI
Hume AI lanza Real World VoiceEQ, un referente para evaluar interacciones de voz de calidad humana. Basado en más de un millón de valoraciones humanas, cubre más de 40 modelos a través de más de 60 métricas, incluyendo ASR (reconocimiento automático del habla), TTS (texto a voz), S2S (habla a habla) y comprensión del habla. El referente reveló que ningún modelo sobresale en todas las categorías y destacó las debilidades de los sistemas actuales en el reconocimiento de emociones y contexto.
El equipo detrás de Hume AI ha presentado el benchmark Real World VoiceEQ, diseñado para evaluar la calidad de la voz de la IA desde una perspectiva humana. Evalúa más de 40 modelos líderes de voz, tanto propietarios como de código abierto, en más de 15 dimensiones clave y más de 60 métricas, que abarcan reconocimiento automático del habla (ASR), síntesis de texto a voz (TTS), conversión de voz a voz (S2S) y comprensión del habla. El benchmark se basa en más de un millón de evaluaciones humanas individuales, recopiladas entre diversos grupos demográficos, estilos de habla y entornos acústicos. La versión actual incluye 785.000 evaluaciones de TTS y 48.000 de S2S, lo que lo convierte en uno de los mayores estudios con participación humana sobre la calidad de la voz en IA. Las evaluaciones se llevaron a cabo en la plataforma Kairos. Según los resultados, ningún sistema individual se clasifica entre los cinco primeros en los ocho grupos de capacidades, lo que pone de relieve que no existe un único modelo de voz "mejor". Los modelos de voz a voz mostraron la mayor variabilidad: algunos funcionaban bien reconociendo emociones, pero no podían responder de forma natural. Resultó que el acceso al audio no garantiza que los agentes utilicen información paralingüística; muchos sistemas siguen dependiendo de transcripciones, ignorando tono, pausas, hesitaciones, entonación y volumen. El benchmark también reveló que los modelos obtienen peores resultados con habla acentuada, voces superpuestas, emociones, ruido de fondo y diálogos largos. Las tasas de error de palabra para el habla ruidosa fueron aproximadamente cuatro veces más altas que con música de fondo. Además, algunos modelos parecen estar optimizados para benchmarks estándar, reproduciendo errores conocidos de transcripciones de referencia. La comparación de los principales modelos de lenguaje del habla (SLM, por sus siglas en inglés) con evaluadores humanos entrenados mostró que la concordancia es mayor en tareas con respuestas correctas claras, pero disminuye en evaluaciones subjetivas, por ejemplo, hacer coincidir una voz con un papel de actuación o preservar la identidad. Los evaluadores automáticos aún no pueden reemplazar a los humanos cuando el juicio depende del contexto acústico y de la interpretación social.
Fuente: Hugging Face blog —
original
