Qwen-TTS habla dialectos: nuevo sintetizador de voz de Alibaba
Alibaba/Qwen
Alibaba ha presentado un modelo Qwen-TTS actualizado (qwen-tts-latest), entrenado en millones de horas de habla. Soporta tres dialectos chinos y siete voces bilingües, y ajusta automáticamente la prosodia, el tempo y las emociones según el texto. El modelo está disponible a través de la API Qwen.
Alibaba объявила о выходе обновлённой версии своей текстово-речевой модели Qwen-TTS (qwen-tts-latest или qwen-tts-2025-05-22), которая доступна через Qwen API. Модель обучена на крупномасштабном наборе данных, включающем миллионы часов речи, что позволяет ей достигать естественности и выразительности на уровне человека. Ключевая особенность — автоматическая подстройка просодики, темпа и эмоциональных интонаций под входной текст. Qwen-TTS поддерживает генерацию речи на трёх китайских диалектах: пекинском, шанхайском и сычуаньском. Всего представлено семь двуязычных голосов (китайско-английских): Cherry, Ethan, Chelsie, Serena, Dylan (пекинский), Jada (шанхайский) и Sunny (сычуаньский). В ближайшее время ожидается расширение языковой и стилистической поддержки. Модель также продемонстрировала высокие показатели на бенчмарке SeedTTS-Eval: низкий WER и высокое сходство голоса. Для использования через Qwen API прилагается пример кода на Python. Alibaba планирует дальнейшие улучшения и расширение поддержки языков.
Fuente: Alibaba Qwen —
original
