Génération Média 🇺🇸 27.07.2026 15:06

Mistral AI lance Voxtral TTS, un modèle de synthèse vocale multilingue

MistralMistral ElevenLabsElevenLabs
Mistral AI a publié Voxtral TTS, un modèle de synthèse vocale de 4 milliards de paramètres qui produit une parole réaliste et expressive sur le plan émotionnel dans 9 langues, avec une faible latence et une adaptation facile de la voix. Il est disponible via API et Mistral Studio, à partir de 0,016 $ pour 1 000 caractères.
Mistral AI a annoncé Voxtral TTS, son premier modèle de synthèse vocale doté de 4 milliards de paramètres, offrant une génération vocale multilingue de pointe. Le modèle prend en charge 9 langues : anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi et arabe. Il se caractérise par une faible latence (70 millisecondes de latence du modèle), une adaptation vocale cross-langue en zero-shot et une compréhension contextuelle pour l'expressivité émotionnelle. L'adaptation vocale nécessite aussi peu que 3 secondes d'audio de référence. Des évaluations humaines ont montré une naturel supérieur par rapport à ElevenLabs Flash v2.5 tout en égalant la qualité d'ElevenLabs v3. L'architecture comprend un transformeur décodeur principal de 3,4 milliards de paramètres, un transformeur acoustique à flux adaptatif de 390 millions de paramètres et un codec audio neuronal de 300 millions de paramètres. Disponible via API à 0,016 dollar par millier de caractères et dans Mistral Studio. Une partie des poids du modèle est ouverte sur Hugging Face sous licence CC BY NC 4.0.
Source: Mistral AI — original
Nos articles précédents sur ce sujet ↓
Infos fraîches