Qwen-TTS agora fala dialetos: novo sintetizador de voz da Alibaba
Alibaba/Qwen
A Alibaba Cloud atualizou o Qwen-TTS, um modelo de texto-para-fala que suporta 3 dialetos chineses (pequinês, xangainês, sichuanês) e 7 vozes bilíngues chinês-inglês. O modelo atinge naturalidade e expressividade em nível humano, disponível via API Qwen.
A Alibaba Cloud anunciou o modelo Qwen-TTS mais recente (qwen-tts-latest ou qwen-tts-2025-05-22) por meio da API Qwen. Treinado em milhões de horas de fala, ele ajusta automaticamente prosódia, ritmo e inflexões emocionais. O modelo suporta 3 dialetos chineses — pequinês, xangainês e sichuanês — com 7 vozes bilíngues chinês-inglês, incluindo Cherry, Ethan, Chelsie, Serena, Dylan (pequinês), Jada (xangainês) e Sunny (sichuanês). As métricas de desempenho no benchmark SeedTTS-Eval mostram baixa taxa de erro de palavras e alta similaridade de locutor. Mais idiomas e estilos estão planejados. O uso é demonstrado por meio de um trecho de código Python usando a API DashScope.
Fonte: Alibaba Qwen —
original
