МоделиГенерация медиа 🇺🇸 27.07.2026 15:06

Mistral AI представила Voxtral TTS — новую мультиязычную модель синтеза речи

MistralMistral ElevenLabsElevenLabs
Компания Mistral AI выпустила Voxtral TTS — модель синтеза речи с 4 млрд параметров, поддерживающую 9 языков, эмоционально выразительную речь, низкую задержку и лёгкую адаптацию к голосам. Модель доступна через API и Mistral Studio, стоимость — от $0,016 за 1 тыс. символов.
Mistral AI запустила Voxtral TTS — свою первую модель синтеза речи с 4 млрд параметров. Она обеспечивает реалистичную, эмоционально окрашенную речь на 9 языках с учётом диалектов, низкую задержку (70 мс для типового образца) и простую адаптацию к новым голосам. Модель превосходит ElevenLabs Flash v2.5 по естественности при сравнимой задержке и сопоставима по качеству с ElevenLabs v3. Voxtral TTS
Показать ещё ↓
Сокращения
TTS = Text-to-Speech — синтез речи из текста
API = Application Programming Interface — программный интерфейс приложения
RTF = Real-Time Factor — коэффициент реального времени
TTFA = Time-to-First-Audio — время до первого аудио
NFE = Number of Function Evaluations — количество вычислений функции
VQ = Vector Quantization — векторное квантование
FSQ = Finite Scalar Quantization — конечное скалярное квантование
LLM = Large Language Model — большая языковая модель
CC BY NC 4.0 = Creative Commons Attribution-NonCommercial 4.0 International — лицензия Creative Commons «С указанием авторства — Некоммерческая» версии 4.0
Источник: Mistral AI — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости