поддерживает zero-shot адаптацию голоса как в рамках одного языка, так и кросс-язычную (например, французский акцент в английской речи). Архитектура включает трансформерный декодер на 3,4 млрд параметров, акустический трансформер (390 млн) и нейронный аудиокодек (300 млн) собственной разработки. Для настройки на конкретный голос достаточно образца длительностью от 3 секунд. Модель доступна через API (от $0,016 за 1 тыс. символов) и в Mistral Studio, а также в виде открытых весов на Hugging Face под лицензией CC BY NC 4.0.