Mediatuotanto 🇺🇸 27.07.2026 15:06

Mistral AI julkaisee Voxtral TTS -monikielisen puhesynteesimallin

MistralMistral ElevenLabsElevenLabs
Mistral AI on julkaissut Voxtral TTS:n, 4 miljardin parametrin tekstistä puheeksi -mallin, joka tuottaa realistista, tunteita ilmaisevaa puhetta 9 kielellä matalalla viiveellä ja helpolla äänen mukauttamisella. Se on saatavilla API:n ja Mistral Studion kautta, alkaen 0,016 dollarista 1 000 merkkiä kohti.
Mistral AI julkisti Voxtral TTS -mallinsa, ensimmäisen tekstistä puheeksi -mallinsa, jossa on 4 miljardia parametria ja joka tarjoaa huippuluokan monikielistä puheentuottoa. Malli tukee 9 kieltä: englantia, ranskaa, saksaa, espanjaa, hollantia, portugalia, italiaa, hindiä ja arabiaa. Siinä on alhainen viive (70 ms mallin viive), nollapisteen ristiinkielinen äänen mukautus ja kontekstuaalinen ymmärrys tunneilmaisulle. Äänen mukautus vaatii vain 3 sekuntia vertailuääntä. Ihmisten suorittamissa arvioissa havaittiin parempi luonnollisuus verrattuna ElevenLabs Flash v2.5:een, samalla kun laatu vastasi ElevenLabs v3:a. Arkkitehtuuri sisältää 3,4 miljardin parametrin transformeri-dekooderin, 390 miljoonan parametrin flow-matching-akustisen transformeriin ja 300 miljoonan parametrin neuroaudio-codecin. Saatavana API:n kautta hintaan 0,016 dollaria per 1 000 merkkiä ja Mistral Studiossa. Osa mallin painoista on avoimesti saatavilla Hugging Facessa CC BY NC 4.0 -lisenssillä.
Lähde: Mistral AI — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset