ModèlesGénération Média 🇨🇳 27.07.2026 18:04

Qwen-TTS parle les dialectes : nouveau synthétiseur vocal d’Alibaba

Alibaba/QwenAlibaba/Qwen
Alibaba a dévoilé une version mise à jour de son modèle Qwen-TTS (qwen-tts-latest), entraîné sur des millions d’heures de parole. Il prend en charge trois dialectes chinois et sept voix bilingues, et ajuste automatiquement la prosodie, le tempo et les émotions en fonction du texte. Le modèle est disponible via l’API Qwen.
Alibaba a annoncé la sortie d'une version mise à jour de son modèle de synthèse vocale Qwen-TTS (qwen-tts-latest ou qwen-tts-2025-05-22), désormais disponible via l'API Qwen. Le modèle a été entraîné sur un jeu de données à grande échelle comprenant des millions d'heures de parole, ce qui lui permet d'atteindre un naturel et une expressivité comparables à ceux d'un humain. Sa principale caractéristique est l'ajustement automatique de la prosodie, du débit et des intonations émotionnelles en fonction du texte d'entrée. Qwen-TTS prend en charge la génération de parole dans trois dialectes chinois : pékinois, shanghaïen et sichuanais. Sept voix bilingues (chinois-anglais) sont proposées : Cherry, Ethan, Chelsie, Serena, Dylan (pékinois), Jada (shanghaïen) et Sunny (sichuanais). Une extension du support linguistique et stylistique est attendue prochainement. Le modèle a également obtenu d'excellents résultats sur le benchmark SeedTTS-Eval : un faible taux d'erreur de mots (WER) et une grande similarité vocale. Un exemple de code Python est fourni pour l'utilisation via l'API Qwen. Alibaba prévoit d'autres améliorations et l'extension du support linguistique.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches