Mistral AI представила Voxtral TTS — новую мультиязычную модель синтеза речи
Mistral
ElevenLabs
Компания Mistral AI выпустила Voxtral TTS — модель синтеза речи с 4 млрд параметров, поддерживающую 9 языков, эмоционально выразительную речь, низкую задержку и лёгкую адаптацию к голосам. Модель доступна через API и Mistral Studio, стоимость — от $0,016 за 1 тыс. символов.
Mistral AI запустила Voxtral TTS — свою первую модель синтеза речи с 4 млрд параметров. Она обеспечивает реалистичную, эмоционально окрашенную речь на 9 языках с учётом диалектов, низкую задержку (70 мс для типового образца) и простую адаптацию к новым голосам. Модель превосходит ElevenLabs Flash v2.5 по естественности при сравнимой задержке и сопоставима по качеству с ElevenLabs v3. Voxtral TTS
Показать ещё ↓
- Сокращения
- TTS = Text-to-Speech — синтез речи из текста
- API = Application Programming Interface — программный интерфейс приложения
- RTF = Real-Time Factor — коэффициент реального времени
- TTFA = Time-to-First-Audio — время до первого аудио
- NFE = Number of Function Evaluations — количество вычислений функции
- VQ = Vector Quantization — векторное квантование
- FSQ = Finite Scalar Quantization — конечное скалярное квантование
- LLM = Large Language Model — большая языковая модель
- CC BY NC 4.0 = Creative Commons Attribution-NonCommercial 4.0 International — лицензия Creative Commons «С указанием авторства — Некоммерческая» версии 4.0
Источник: Mistral AI —
оригинал
