ModelGenerasi Media 🇺🇸 27.07.2026 15:06

Mistral AI Unveils Voxtral TTS — New Multilingual Speech Synthesis Model

MistralMistral ElevenLabsElevenLabs
Mistral AI has released Voxtral TTS, a speech synthesis model with 4 billion parameters that supports 9 languages, emotionally expressive speech, low latency, and easy voice adaptation. The model is available via API and Mistral Studio, starting at $0.016 per 1,000 characters.
Mistral AI meluncurkan Voxtral TTS — model sintesis suara pertamanya dengan 4 miliar parameter. Model ini menghasilkan ucapan yang realistis dan bernuansa emosional dalam 9 bahasa dengan mempertimbangkan dialek, latensi rendah (70 ms untuk sampel tipikal), dan adaptasi sederhana ke suara baru. Model ini mengungguli ElevenLabs Flash v2.5 dalam hal naturalness dengan latensi yang sebanding dan kualitas yang setara dengan ElevenLabs v3. Voxtral TTS mendukung adaptasi suara zero-shot baik dalam satu bahasa maupun lintas bahasa (misalnya, aksen Prancis dalam ucapan bahasa Inggris). Arsitekturnya mencakup decoder transformer 3,4 miliar parameter, acoustic transformer (390 juta), dan neural audio codec (300 juta) buatan sendiri. Untuk menyesuaikan dengan suara tertentu, cukup sampel berdurasi minimal 3 detik. Model ini tersedia melalui API (mulai dari $0,016 per 1.000 karakter) dan di Mistral Studio, serta dalam bentuk bobot terbuka di Hugging Face dengan lisensi CC BY NC 4.0.
Sumber: Mistral AI — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru