Mistral AI onthult Voxtral TTS — Nieuw meertalig spraaksynthesemodel
Mistral
ElevenLabs
Mistral AI heeft Voxtral TTS uitgebracht, een spraaksynthesemodel met 4 miljard parameters dat 9 talen ondersteunt, emotioneel expressieve spraak, lage latentie en eenvoudige stemaanpassing biedt. Het model is beschikbaar via API en Mistral Studio, vanaf $0,016 per 1.000 tekens.
Mistral AI heeft Voxtral TTS gelanceerd, haar eerste spraaksynthesemodel met 4 miljard parameters. Het levert realistische, emotioneel genuanceerde spraak in 9 talen met inachtneming van dialecten, een lage latentie (70 ms voor een typisch voorbeeld) en eenvoudige aanpassing aan nieuwe stemmen. Het model overtreft ElevenLabs Flash v2.5 in natuurlijkheid bij vergelijkbare latentie en is qua kwaliteit vergelijkbaar met ElevenLabs v3. Voxtral TTS ondersteunt zero-shot stemadaptatie, zowel binnen één taal als cross-linguaal (bijvoorbeeld een Frans accent in Engelse spraak). De architectuur omvat een transformator-decoder met 3,4 miljard parameters, een akoestische transformator (390 miljoen) en een eigen neurale audiocodec (300 miljoen). Voor het afstemmen op een specifieke stem is een voorbeeld van minimaal 3 seconden voldoende. Het model is beschikbaar via een API (vanaf $0,016 per 1000 tekens) en in Mistral Studio, evenals als open gewichten op Hugging Face onder de CC BY NC 4.0-licentie.
Bron: Mistral AI —
origineel
