Mistral AI presenta Voxtral TTS — nuevo modelo de síntesis de voz multilingüe
Mistral
ElevenLabs
Mistral AI ha lanzado Voxtral TTS, un modelo de síntesis de voz con 4 mil millones de parámetros que admite 9 idiomas, habla con expresión emocional, baja latencia y fácil adaptación de voz. El modelo está disponible a través de API y Mistral Studio, con un precio inicial de 0,016 dólares por cada 1.000 caracteres.
Mistral AI ha lanzado Voxtral TTS, su primer modelo de síntesis de voz con 4 mil millones de parámetros. Proporciona un habla realista y emocionalmente matizada en 9 idiomas, teniendo en cuenta dialectos, baja latencia (70 ms para una muestra típica) y una fácil adaptación a nuevas voces. El modelo supera a ElevenLabs Flash v2.5 en naturalidad con una latencia comparable y es comparable en calidad a ElevenLabs v3. Voxtral TTS admite adaptación de voz zero-shot tanto dentro del mismo idioma como entre idiomas (por ejemplo, un acento francés en el habla inglesa). La arquitectura incluye un decodificador transformador de 3.4 mil millones de parámetros, un transformador acústico (390 millones) y un códec de audio neuronal (300 millones) de desarrollo propio. Para ajustarse a una voz específica, basta con una muestra de al menos 3 segundos de duración. El modelo está disponible a través de API (desde $0.016 por cada mil caracteres) y en Mistral Studio, así como en forma de pesos abiertos en Hugging Face bajo la licencia Creative Commons Attribution-NonCommercial 4.0 International.
Fuente: Mistral AI —
original
