モデルオープンソース 🇺🇸 27.07.2026 16:05

Mistral AI、超低遅延音声認識モデル「Voxtral Transcribe 2」をリリース

MistralMistral Mistral AIMistral AI
Mistral AIは、音声からテキストへの変換モデル群「Voxtral Transcribe 2」を発表しました。バッチ文字起こし用のVoxtral Mini Transcribe V2と、200ミリ秒未満の遅延でライブアプリケーションに対応するVoxtral Realtimeが含まれます。Voxtral RealtimeはApache 2.0ライセンスでオープンウェイトとして公開されています。両モデルとも13言語をサポートし、話者ダイアライゼーション(話者分離)機能を備えた最先端の文字起こし品質を提供します。
Mistral AIは、次世代の音声認識モデルファミリー「Voxtral Transcribe 2」をリリースしました。これには、バッチ処理向けの「Voxtral Mini Transcribe V2」と、設定可能なレイテンシーを200ミリ秒未満に抑えたライブ音声認識向けの「Voxtral Realtime」が含まれます。Voxtral Realtimeは、Apache 2.0ライセンスでオープンウェイトとして公開されています。両モデルとも、英語、中国語、ヒンディー語、スペイン語、アラビア語、フランス語、ポルトガル語、ロシア語、ドイツ語、日本語、韓国語、イタリア語、オランダ語の13言語に対応しています。Voxtral Mini Transcribe V2は、FLEURSベンチマークで約4%の単語誤り率を達成し、1分あたり0.003ドルと、GPT-4o mini TranscribeやGemini 2.5 Flashなどの競合製品を凌駕しています。また、話者識別、コンテキストバイアシング、単語レベルのタイムスタンプ、ノイズ耐性を備え、最大3時間の音声に対応します。Voxtral Realtimeは、4Bパラメータの軽量モデルで、エッジデバイス上でも効率的に動作し、480ミリ秒の遅延でもほぼオフライン並みの精度を提供します。Mistralはさらに、話者識別とタイムスタンプ付きの音声認識をテストできるオーディオプレイグラウンドをMistral Studio内に立ち上げました。
出典: Mistral AI — 原文
関連記事 ↓
新着ニュース