ModelleMediengenerierung 🇺🇸 27.07.2026 15:06

Mistral AI stellt Voxtral TTS vor – neues mehrsprachiges Sprachsynthesemodell

MistralMistral ElevenLabsElevenLabs
Mistral AI hat Voxtral TTS veröffentlicht, ein Sprachsynthesemodell mit 4 Milliarden Parametern, das 9 Sprachen, emotional ausdrucksstarke Sprache, niedrige Latenz und einfache Stimmadaption unterstützt. Das Modell ist über API und Mistral Studio ab 0,016 US-Dollar pro 1.000 Zeichen verfügbar.
Mistral AI hat Voxtral TTS veröffentlicht – sein erstes Sprachsynthesemodell mit vier Milliarden Parametern. Es erzeugt realistische, emotional gefärbte Sprache in neun Sprachen unter Berücksichtigung von Dialekten, bietet eine niedrige Latenz (70 Millisekunden für eine typische Probe) und eine einfache Anpassung an neue Stimmen. Das Modell übertrifft ElevenLabs Flash v2.5 in puncto Natürlichkeit bei vergleichbarer Latenz und ist qualitativ mit ElevenLabs v3 vergleichbar. Voxtral TTS unterstützt die Zero-Shot-Anpassung von Stimmen sowohl innerhalb einer Sprache als auch sprachübergreifend (zum Beispiel französischer Akzent in englischer Sprache). Die Architektur umfasst einen Transformer-Decoder mit 3,4 Milliarden Parametern, einen akustischen Transformer (390 Millionen) und einen eigens entwickelten neuronalen Audiocodec (300 Millionen). Für die Anpassung an eine bestimmte Stimme reicht eine Probe von mindestens drei Sekunden Länge aus. Das Modell ist über die API verfügbar (ab 0,016 US-Dollar pro 1.000 Zeichen) sowie in Mistral Studio und als offene Gewichte auf Hugging Face unter der Lizenz CC BY NC 4.0.
Quelle: Mistral AI — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten