Генерация медиаМодели 🇺🇸 21.07.2026 01:01

Alibaba Tongyi Lab выпустила Qwen-Audio-3.0-TTS — синтезатор речи на 16 языков в версиях Flash и Plus

Alibaba/QwenAlibaba/Qwen
Alibaba Tongyi Lab представила Qwen-Audio-3.0-TTS — систему синтеза речи (TTS, text-to-speech), доступную в двух вариантах: Flash для real-time взаимодействия (задержка первого пакета ~300 мс) и Plus для высококачественной генерации. Модели работают через облачный сервис Alibaba Cloud Model Studio, поддерживают 16 языков, клонирование голоса, голосовой дизайн и 86 точных тегов для невербальных эффектов (смех, дыхание, кашель). Plus занял первое место в рейтинге Artificial Analysis TTS с Elo ~1236, при этом цена составляет около $27,59 за 1 млн символов, что примерно в три раза дешевле аналогов.
Лаборатория Tongyi, входящая в Alibaba, выпустила производственную систему синтеза речи Qwen-Audio-3.0-TTS, доступную в двух вариантах: Flash (ориентирован на real-time, задержка первого пакета ~300 мс) и Plus (приоритет качества). Обе версии предоставляются как hosted-модели через Alibaba Cloud Model Studio, а не в виде загружаемых весов. Система построена на низкочастотном токенизаторе речи (12,5 Гц) и пятиступенчатой прогрессивной тренировке, включающей раздельное предобучение языковой модели (LM) и согласования потоков (FM), затем совместное обучение с очисткой данных, RLHF для LM, тренировку устойчивости FM и RL для FM. Это обеспечивает согласованность контента, естественную просодику, точность тембра, перцептивное качество и устойчивость. Flash и Plus поддерживают 16 языков (арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский) и 20 китайских диалектов; семь языков добавлены впервые. По показателю WER/CER (word/character error rate) семейство моделей занимает первое место в 10 из 16 языков; Flash показывает средний WER/CER 3,87, Plus — 3,96 (чем ниже, тем лучше). По сходству голоса (голосовое клонирование) Plus лидирует во всех 16 языках со средним показателем 82,75, Flash — 80,44. В модели доступна библиотека профессиональных голосов. Для точного контроля предусмотрены 86 встроенных тегов, разделённых на контрольные (например, [excited], [sad], [whispers], [asmr]) и голосовые эффекты ([laughing], [gasp], [clears throat]); они работают только в однонаправленном потоковом режиме. Plus занял первое место в рейтинге Artificial Analysis Speech Arena для голосов провайдеров с Elo ~1236, опережая Simba 3.2 (1234), Gemini 3.1 Flash TTS (1214) и Sonic 3.5 (1207), но разница с лидером находится в пределах доверительных интервалов. Пропускная способность Plus — около 16 символов в секунду, что ниже конкурентов; цена — $27,59 за 1 млн символов, примерно в три раза дешевле ElevenLabs и MiniMax. Реакция сообщества в целом положительная: отмечают, что не-западная TTS возглавила рейтинг по гораздо меньшей цене, но критикуют отсутствие open-source и низкую пропускную способность.
Сокращения
TTS = Text-to-Speech — синтез речи
LM = Language Model — языковая модель
FM = Flow Matching — согласование потоков
RLHF = Reinforcement Learning from Human Feedback — обучение с подкреплением на основе человеческой обратной связи
WER = Word Error Rate — частота ошибок в словах
CER = Character Error Rate — частота ошибок в символах
SDK = Software Development Kit — комплект для разработки
API = Application Programming Interface — программный интерфейс приложения
Источник: MarkTechPost — оригинал

Наши прошлые публикации по теме

Есть свежие новости