メディア生成 🇺🇸 27.07.2026 15:06

Mistral AI、多言語音声合成モデルVoxtral TTSを公開

MistralMistral ElevenLabsElevenLabs
Mistral AIは、40億パラメータのテキスト読み上げモデルVoxtral TTSをリリースしました。9言語でリアルで感情表現豊かな音声を低レイテンシで提供し、簡単な音声適応が可能です。APIおよびMistral Studioで利用可能で、価格は1,000文字あたり0.016ドルからです。
Mistral AIは、同社初のテキスト音声変換モデル「Voxtral TTS」を発表しました。4Bパラメータを備え、最先端の多言語音声生成を提供します。このモデルは、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語をサポートしています。低レイテンシ(モデル遅延70ミリ秒)、ゼロショットの言語横断的音声適応、および感情表現のための文脈理解を特長とします。音声適応には、わずか3秒の参照音声が必要です。人間による評価では、ElevenLabs Flash v2.5よりも自然さが優れており、ElevenLabs v3の品質に匹敵することが示されました。アーキテクチャは、3.4BのTransformerデコーダバックボーン、390Mのフローマッチング音響Transformer、300Mのニューラルオーディオコーデックで構成されています。API経由で1,000文字あたり0.016ドル、およびMistral Studioで利用可能です。モデル重みの一部は、CC BY NC 4.0ライセンスでHugging Face上に公開されています。
出典: Mistral AI — 原文
関連記事 ↓
新着ニュース