Qwen-TTS parle désormais dialectes : nouveau synthétiseur vocal d'Alibaba
Alibaba/Qwen
Alibaba Cloud a mis à jour Qwen-TTS, un modèle de synthèse vocale qui prend en charge 3 dialectes chinois (pékinois, shanghaïen, sichuanais) et 7 voix bilingues chinois-anglais. Le modèle atteint un naturel et une expressivité de niveau humain, disponible via l'API Qwen.
Alibaba Cloud a annoncé le dernier modèle Qwen-TTS (qwen-tts-latest ou qwen-tts-2025-05-22) via l'API Qwen. Entraîné sur des millions d'heures de parole, il ajuste automatiquement la prosodie, le rythme et les inflexions émotionnelles. Il prend en charge trois dialectes chinois — le pékinois, le shanghaïen et le sichuanais — avec sept voix bilingues chinois-anglais, dont Cherry, Ethan, Chelsie, Serena, Dylan (pékinois), Jada (shanghaïen) et Sunny (sichuanais). Les mesures de performance sur le benchmark SeedTTS-Eval montrent un faible taux d'erreur lexicale et une grande similarité vocale. D'autres langues et styles sont prévus. L'utilisation est démontrée via un extrait de code Python utilisant l'API DashScope.
Source: Alibaba Qwen —
original
