ModèlesGénération Média 🇺🇸 27.07.2026 15:06

Mistral AI dévoile Voxtral TTS — un nouveau modèle de synthèse vocale multilingue

MistralMistral ElevenLabsElevenLabs
Mistral AI a publié Voxtral TTS, un modèle de synthèse vocale de 4 milliards de paramètres qui prend en charge 9 langues, une parole émotionnellement expressive, une faible latence et une adaptation vocale facile. Le modèle est disponible via API et Mistral Studio, à partir de 0,016 dollar par 1 000 caractères.
Mistral AI a lancé Voxtral TTS, son premier modèle de synthèse vocale avec 4 milliards de paramètres. Il produit une parole réaliste et expressive en 9 langues, en tenant compte des dialectes, avec une faible latence (70 ms pour un échantillon type) et une adaptation simplifiée à de nouvelles voix. Le modèle surpasse ElevenLabs Flash v2.5 en naturel pour une latence comparable et se rapproche de la qualité de ElevenLabs v3. Voxtral TTS prend en charge l'adaptation vocale zero-shot, que ce soit dans une même langue ou en mode interlingue (par exemple, un accent français dans un discours en anglais). L'architecture comprend un décodeur transformeur de 3,4 milliards de paramètres, un transformeur acoustique (390 millions) et un codec audio neuronal (300 millions) développé en interne. Pour paramétrer une voix spécifique, un échantillon de 3 secondes suffit. Le modèle est accessible via API (à partir de 0,016 dollar pour 1 000 caractères) et dans Mistral Studio, ainsi que sous forme de poids ouverts sur Hugging Face sous licence CC BY-NC 4.0.
Source: Mistral AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches