ModelsMedia Generation 🇨🇳 27.07.2026 18:04

Qwen-TTS speaks dialects: new speech synthesizer from Alibaba

Alibaba/QwenAlibaba/Qwen
Alibaba has unveiled an updated Qwen-TTS model (qwen-tts-latest), trained on millions of hours of speech. It supports three Chinese dialects and seven bilingual voices, and automatically adjusts prosody, tempo, and emotions according to the text. The model is available via the Qwen API.
Alibaba объявила о выходе обновлённой версии своей текстово-речевой модели Qwen-TTS (qwen-tts-latest или qwen-tts-2025-05-22), которая доступна через Qwen API. Модель обучена на крупномасштабном наборе данных, включающем миллионы часов речи, что позволяет ей достигать естественности и выразительности на уровне человека. Ключевая особенность — автоматическая подстройка просодики, темпа и эмоциональных интонаций под входной текст. Qwen-TTS поддерживает генерацию речи на трёх китайских диалектах: пекинском, шанхайском и сычуаньском. Всего представлено семь двуязычных голосов (китайско-английских): Cherry, Ethan, Chelsie, Serena, Dylan (пекинский), Jada (шанхайский) и Sunny (сычуаньский). В ближайшее время ожидается расширение языковой и стилистической поддержки. Модель также продемонстрировала высокие показатели на бенчмарке SeedTTS-Eval: низкий WER и высокое сходство голоса. Для использования через Qwen API прилагается пример кода на Python. Alibaba планирует дальнейшие улучшения и расширение поддержки языков.
Source: Alibaba Qwen — original
Our earlier posts on this topic ↓
Fresh news