ModelosGeração de Mídia 🇺🇸 27.07.2026 15:06

Mistral AI apresenta Voxtral TTS — novo modelo de síntese de fala multilíngue

MistralMistral ElevenLabsElevenLabs
A Mistral AI lançou o Voxtral TTS, um modelo de síntese de fala com 4 bilhões de parâmetros que suporta 9 idiomas, fala emocionalmente expressiva, baixa latência e fácil adaptação de voz. O modelo está disponível via API e Mistral Studio, a partir de US$ 0,016 por 1.000 caracteres.
Mistral AI lançou o Voxtral TTS — seu primeiro modelo de síntese de fala com 4 bilhões de parâmetros. Ele produz fala realista e emocionalmente expressiva em 9 idiomas, levando em conta dialetos, baixa latência (70 ms para uma amostra típica) e fácil adaptação a novas vozes. O modelo supera o ElevenLabs Flash v2.5 em naturalidade com latência comparável e é comparável em qualidade ao ElevenLabs v3. O Voxtral TTS suporta adaptação de voz zero-shot tanto dentro de um mesmo idioma quanto entre idiomas (por exemplo, sotaque francês na fala em inglês). A arquitetura inclui um decodificador transformer de 3,4 bilhões de parâmetros, um transformer acústico (390 milhões) e um codec de áudio neural (300 milhões) desenvolvido internamente. Para ajustar a voz específica, basta uma amostra com duração a partir de 3 segundos. O modelo está disponível via API (a partir de US$ 0,016 por 1 mil caracteres) e no Mistral Studio, também como pesos abertos no Hugging Face sob a licença Creative Commons Atribuição-NãoComercial 4.0 Internacional.
Fonte: Mistral AI — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas