Mistral AI esittelee Voxtral TTS:n – uuden monikielisen puhesynteesimallin
Mistral
ElevenLabs
Mistral AI on julkaissut Voxtral TTS:n, 4 miljardin parametrin puhesynteesimallin, joka tukee 9 kieltä, tunteita ilmaisevaa puhetta, pientä viivettä ja helppoa äänen mukauttamista. Malli on saatavilla API:n ja Mistral Studion kautta, alkaen 0,016 dollarista 1 000 merkiltä.
Mistral AI on julkaissut Voxtral TTS -mallin, joka on sen ensimmäinen puhesynteesimalli, jossa on 4 miljardia parametria. Se tuottaa realistista, tunnevärittynyttä puhetta yhdeksällä kielellä ottaen huomioon murteet, ja sen viive on pieni (70 millisekuntia tyypilliselle näytteelle), ja se mukautuu helposti uusiin ääniin. Malli päihittää ElevenLabs Flash v2.5:n luonnollisuudessa samalla viiveellä ja on laadultaan verrattavissa ElevenLabs v3:een. Voxtral TTS tukee nollasammuttamista (zero-shot) äänen mukauttamisessa sekä yhden kielen sisällä että kielten välillä (esim. ranskalainen aksentti englanninkielisessä puheessa). Arkisto sisältää 3,4 miljardin parametrin muunnindekooderin, akustisen muuntimen (390 miljoonaa) ja oman kehityksen olevan neuroverkkopohjaisen äänikoodekin (300 miljoonaa). Tietyn äänen säätämiseen riittää vähintään kolmen sekunnin mittainen näyte. Malli on saatavilla API:n kautta (alkaen 0,016 dollarista tuhatta merkkiä kohden) ja Mistral Studiossa sekä avoimina painoina Hugging Facessa CC BY NC 4.0 -lisenssillä.
Lähde: Mistral AI —
Alkuperäinen
