Medya Üretimi 🇺🇸 27.07.2026 15:06

Mistral AI, çok dilli konuşma sentezi modeli Voxtral TTS'i piyasaya sürdü

MistralMistral ElevenLabsElevenLabs
Mistral AI, 4 milyar parametreli Voxtral TTS metin-konuşma modelini yayınladı. Model, düşük gecikme ve kolay ses uyarlaması ile 9 dilde gerçekçi, duygusal ifade içeren konuşma üretiyor. API ve Mistral Studio üzerinden kullanılabilen model, bin karakter başına 0,016 ABD dolarından başlayan fiyatlarla sunuluyor.
Mistral AI, ilk metin-konuşma modeli olan 4 milyar parametreli Voxtral TTS'yi duyurdu. Model, dokuz dilde (İngilizce, Fransızca, Almanca, İspanyolca, Felemenkçe, Portekizce, İtalyanca, Hintçe ve Arapça) son teknoloji çok dilli ses üretimi sunuyor. Düşük gecikme süresi (70 ms model gecikmesi), sıfır atışlı çapraz dil ses uyarlaması ve duygusal ifade için bağlamsal anlama özelliklerine sahip. Ses uyarlaması yalnızca 3 saniyelik referans ses gerektiriyor. İnsan değerlendirmeleri, ElevenLabs Flash v2.5'e kıyasla üstün doğallık gösterirken ElevenLabs v3 kalitesiyle eşleşti. Mimari, 3,4 milyar parametreli bir transformer kod çözücü omurgası, 390 milyon parametreli flow-matching akustik transformer ve 300 milyon parametreli nöral ses codec'inden oluşuyor. API üzerinden bin karakter başına 0,016 dolar ve Mistral Studio'da kullanıma sunuldu. Model ağırlıklarının bir kısmı, CC BY NC 4.0 lisansıyla Hugging Face'te açık kaynak olarak yayınlandı.
Kaynak: Mistral AI — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler