Mistral AI bringt Voxtral TTS auf den Markt, ein mehrsprachiges Sprachsynthesemodell
Mistral
ElevenLabs
Mistral AI hat Voxtral TTS veröffentlicht, ein Text-to-Speech-Modell mit 4 Milliarden Parametern, das realistische, emotional ausdrucksstarke Sprache in 9 Sprachen mit niedriger Latenz und einfacher Sprachadaption liefert. Es ist über API und Mistral Studio verfügbar, ab $0,016 pro 1.000 Zeichen.
Mistral AI hat Voxtral TTS vorgestellt, sein erstes Text-to-Speech-Modell mit 4 Milliarden Parametern, das moderne mehrsprachige Sprachgenerierung bietet. Das Modell unterstützt 9 Sprachen: Englisch, Französisch, Deutsch, Spanisch, Niederländisch, Portugiesisch, Italienisch, Hindi und Arabisch. Es zeichnet sich durch geringe Latenz (70 Millisekunden Modelllatenz), Zero-Shot crosslinguale Sprachadaption und kontextuelles Verständnis für emotionale Ausdruckskraft aus. Die Sprachadaption benötigt nur 3 Sekunden Referenzaudio. Menschliche Bewertungen zeigten überlegene Natürlichkeit im Vergleich zu ElevenLabs Flash v2.5, während sie die Qualität von ElevenLabs v3 erreichten. Die Architektur umfasst einen 3,4 Milliarden Parameter umfassenden Transformer-Decoder-Backbone, einen 390 Millionen Parameter umfassenden Flow-Matching-Acoustic-Transformer und einen 300 Millionen Parameter umfassenden neuronalen Audio-Codec. Verfügbar über API zu 0,016 USD pro 1.000 Zeichen und in Mistral Studio. Ein Teil der Modellgewichte ist auf Hugging Face unter CC BY NC 4.0 offen.
Quelle: Mistral AI —
Original
