Mistral AI lança Voxtral TTS, um modelo de síntese de fala multilíngue
Mistral
ElevenLabs
A Mistral AI lançou o Voxtral TTS, um modelo de texto para fala com 4 bilhões de parâmetros que produz fala realista e emocionalmente expressiva em 9 idiomas, com baixa latência e fácil adaptação de voz. Está disponível via API e Mistral Studio, a partir de $0,016 por 1.000 caracteres.
A Mistral AI anunciou o Voxtral TTS, seu primeiro modelo de texto para fala com 4 bilhões de parâmetros, oferecendo geração de voz multilíngue de última geração. O modelo suporta 9 idiomas: inglês, francês, alemão, espanhol, holandês, português, italiano, hindi e árabe. Ele apresenta baixa latência (70ms de latência do modelo), adaptação de voz cross-lingual zero-shot e compreensão contextual para expressividade emocional. A adaptação de voz requer apenas 3 segundos de áudio de referência. Avaliações humanas mostraram naturalidade superior em comparação com o ElevenLabs Flash v2.5, igualando a qualidade do ElevenLabs v3. A arquitetura inclui um backbone de transformador decodificador de 3,4 bilhões de parâmetros, um transformador acústico de fluxo matching de 390 milhões de parâmetros e um codec de áudio neural de 300 milhões de parâmetros. Disponível via API a US$ 0,016 por mil caracteres e no Mistral Studio. Parte dos pesos do modelo está aberta no Hugging Face sob licença CC BY NC 4.0.
Fonte: Mistral AI —
original
