Mediageneratie 🇺🇸 27.07.2026 15:06

Mistral AI lanceert Voxtral TTS, een meertalig spraaksynthesemodel

MistralMistral ElevenLabsElevenLabs
Mistral AI heeft Voxtral TTS uitgebracht, een tekst-naar-spraakmodel met 4 miljard parameters dat realistische, emotioneel expressieve spraak in 9 talen levert met lage latentie en eenvoudige stemaanpassing. Het is beschikbaar via API en Mistral Studio, vanaf $0,016 per 1.000 karakters.
Mistral AI heeft Voxtral TTS aangekondigd, zijn eerste tekst-naar-spraakmodel met 4 miljard parameters, dat state-of-the-art meertalige spraakgeneratie biedt. Het model ondersteunt 9 talen: Engels, Frans, Duits, Spaans, Nederlands, Portugees, Italiaans, Hindi en Arabisch. Het kenmerkt zich door lage latentie (70 ms modellatentie), zero-shot cross-linguale stemaanpassing en contextueel begrip voor emotionele expressiviteit. Voor stemaanpassing is slechts 3 seconden referentieaudio nodig. Menselijke evaluaties toonden superieure natuurlijkheid aan in vergelijking met ElevenLabs Flash v2.5, terwijl de kwaliteit van ElevenLabs v3 werd geëvenaard. De architectuur omvat een 3,4 miljard transformer-decoder backbone, 390 miljoen flow-matching akoestische transformer en 300 miljoen neurale audiocodec. Beschikbaar via API voor $0,016 per 1.000 tekens en in Mistral Studio. Een deel van de modelgewichten is openbaar op Hugging Face onder CC BY-NC 4.0.
Bron: Mistral AI — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws