Qwen-TTS fala dialetos: novo sintetizador de fala da Alibaba
Alibaba/Qwen
A Alibaba lançou um modelo Qwen-TTS atualizado (qwen-tts-latest), treinado em milhões de horas de fala. Ele suporta três dialetos chineses e sete vozes bilíngues, e ajusta automaticamente prosódia, ritmo e emoções de acordo com o texto. O modelo está disponível via API Qwen.
Alibaba объявила о выходе обновлённой версии своей текстово-речевой модели Qwen-TTS (qwen-tts-latest или qwen-tts-2025-05-22), которая доступна через Qwen API. Модель обучена на крупномасштабном наборе данных, включающем миллионы часов речи, что позволяет ей достигать естественности и выразительности на уровне человека. Ключевая особенность — автоматическая подстройка просодики, темпа и эмоциональных интонаций под входной текст. Qwen-TTS поддерживает генерацию речи на трёх китайских диалектах: пекинском, шанхайском и сычуаньском. Всего представлено семь двуязычных голосов (китайско-английских): Cherry, Ethan, Chelsie, Serena, Dylan (пекинский), Jada (шанхайский) и Sunny (сычуаньский). В ближайшее время ожидается расширение языковой и стилистической поддержки. Модель также продемонстрировала высокие показатели на бенчмарке SeedTTS-Eval: низкий WER и высокое сходство голоса. Для использования через Qwen API прилагается пример кода на Python. Alibaba планирует дальнейшие улучшения и расширение поддержки языков.
Fonte: Alibaba Qwen —
original
