ModelosGeneración de Medios 🇨🇳 27.07.2026 18:04

Qwen-TTS ahora habla dialectos: nuevo sintetizador de voz de Alibaba

Alibaba/QwenAlibaba/Qwen
Alibaba Cloud ha actualizado Qwen-TTS, un modelo de texto a voz que admite 3 dialectos chinos (pekinés, shanghainés, sichuanés) y 7 voces bilingües chino-inglés. El modelo alcanza naturalidad y expresividad a nivel humano, disponible a través de la API de Qwen.
Alibaba Cloud ha anunciado el último modelo Qwen-TTS (qwen-tts-latest o qwen-tts-2025-05-22) a través de la API Qwen. Entrenado con millones de horas de voz, ajusta automáticamente la prosodia, el ritmo y las inflexiones emocionales. Admite tres dialectos chinos —pekinés, shanghainés y sichuanés— con siete voces bilingües chino-inglés que incluyen Cherry, Ethan, Chelsie, Serena, Dylan (pekinés), Jada (shanghainés) y Sunny (sichuanés). Las métricas de rendimiento en el benchmark SeedTTS-Eval muestran una baja tasa de error de palabras y una alta similitud con el hablante. Se planean más idiomas y estilos. El uso se demuestra mediante un fragmento de código Python que utiliza la API DashScope.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas