Mistral AI lanza Voxtral TTS, un modelo de síntesis de voz multilingüe
Mistral
ElevenLabs
Mistral AI ha lanzado Voxtral TTS, un modelo de texto a voz de 4 mil millones de parámetros que ofrece un habla realista y emocionalmente expresiva en 9 idiomas con baja latencia y fácil adaptación de voz. Está disponible a través de API y Mistral Studio, desde 0,016 dólares por cada 1.000 caracteres.
Mistral AI ha presentado Voxtral TTS, su primer modelo de texto a voz con 4 mil millones de parámetros, que ofrece generación de voz multilingüe de última generación. El modelo admite 9 idiomas: inglés, francés, alemán, español, neerlandés, portugués, italiano, hindi y árabe. Cuenta con baja latencia (70 ms de latencia del modelo), adaptación de voz cross-lingual sin necesidad de ejemplos previos y comprensión contextual para la expresividad emocional. La adaptación de voz requiere tan solo 3 segundos de audio de referencia. Las evaluaciones humanas mostraron una naturalidad superior en comparación con ElevenLabs Flash v2.5, igualando la calidad de ElevenLabs v3. La arquitectura incluye un transformador decodificador principal de 3.4 mil millones de parámetros, un transformador acústico de flujo de 390 millones de parámetros y un códec de audio neuronal de 300 millones de parámetros. Está disponible a través de API a 0,016 dólares por cada 1000 caracteres y en Mistral Studio. Parte de los pesos del modelo son de código abierto en Hugging Face bajo la licencia CC BY NC 4.0.
Fuente: Mistral AI —
original
