Mistral AI luncurkan Voxtral TTS, model sintesis suara multibahasa
Mistral
ElevenLabs
Mistral AI telah merilis Voxtral TTS, model text-to-speech dengan 4 miliar parameter yang menghasilkan suara realistis dan ekspresif secara emosional dalam 9 bahasa dengan latensi rendah dan adaptasi suara yang mudah. Tersedia melalui API dan Mistral Studio, mulai dari $0.016 per 1.000 karakter.
Mistral AI mengumumkan Voxtral TTS, model text-to-speech pertamanya dengan 4 miliar parameter, yang menawarkan generasi suara multibahasa yang canggih. Model ini mendukung 9 bahasa: Inggris, Prancis, Jerman, Spanyol, Belanda, Portugis, Italia, Hindi, dan Arab. Model ini memiliki latensi rendah (70ms latensi model), adaptasi suara lintas bahasa tanpa contoh sebelumnya, serta pemahaman kontekstual untuk ekspresivitas emosional. Adaptasi suara hanya memerlukan sedikitnya 3 detik audio referensi. Evaluasi manusia menunjukkan kealamian yang lebih unggul dibandingkan ElevenLabs Flash v2.5, sekaligus menyamai kualitas ElevenLabs v3. Arsitekturnya mencakup backbone transformer decoder 3,4 miliar parameter, transformer akustik flow-matching 390 juta parameter, dan codec audio neural 300 juta parameter. Tersedia melalui API seharga $0,016 per 1.000 karakter dan di Mistral Studio. Sebagian bobot model bersifat terbuka di Hugging Face di bawah lisensi CC BY NC 4.0.
Sumber: Mistral AI —
asli
