模型媒体生成 🇺🇸 27.07.2026 15:06

Mistral AI 发布 Voxtral TTS —— 新型多语言语音合成模型

MistralMistral ElevenLabsElevenLabs
Mistral AI 推出了 Voxtral TTS,这是一个拥有 40 亿参数的语音合成模型,支持 9 种语言,具有情感表达、低延迟和易于语音适配的特点。该模型可通过 API 和 Mistral Studio 使用,起价为每 1,000 个字符 0.016 美元。
Mistral AI发布了Voxtral TTS——其首个拥有40亿参数的语音合成模型。该模型能提供逼真、富有情感色彩的语音,涵盖9种语言,并考虑方言差异,延迟低(典型样本为70毫秒),且易于适配新声音。在自然度上,该模型超越ElevenLabs Flash v2.5,延迟相当;在质量上与ElevenLabs v3相当。Voxtral TTS支持同语言及跨语言的零样本语音适配(例如法语口音的英语语音)。其架构包括34亿参数的Transformer解码器、3.9亿参数的声学Transformer以及自研的3亿参数神经音频编解码器。针对特定声音的微调仅需3秒以上的样本即可。该模型可通过API(每千字符0.016美元起)和Mistral Studio使用,也可在Hugging Face上以开放权重形式获取,采用CC BY NC 4.0许可协议。
来源: Mistral AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻