媒体生成 🇺🇸 27.07.2026 15:06

Mistral AI 发布 Voxtral TTS,多语言语音合成模型

MistralMistral ElevenLabsElevenLabs
Mistral AI 发布了 Voxtral TTS,这是一个拥有 40 亿参数的文本转语音模型,能够以低延迟和便捷的语音自适应生成 9 种语言的逼真且富有情感表达的语音。该模型通过 API 和 Mistral Studio 提供,起价为每千字符 0.016 美元。
Mistral AI 发布了其首款文本转语音模型 Voxtral TTS,拥有 40 亿参数,提供最先进的多语言语音生成能力。该模型支持 9 种语言:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。其特点包括低延迟(模型延迟 70 毫秒)、零样本跨语言语音适配以及基于上下文理解的情感表达。语音适配仅需 3 秒的参考音频。人工评估显示,其自然度优于 ElevenLabs Flash v2.5,同时与 ElevenLabs v3 质量相当。架构包括 34 亿参数的 Transformer 解码器主干、3.9 亿参数的流匹配声学 Transformer 以及 3 亿参数的神经音频编解码器。可通过 API 调用,价格为每 1000 字符 0.016 美元,也可在 Mistral Studio 中使用。部分模型权重已在 Hugging Face 上以 CC BY NC 4.0 许可开源。
来源: Mistral AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻