Alibaba、Qwen2-Audioをリリース:音声チャットと分析を備えた新しい音声言語モデル
Alibaba/Qwen
Alibabaは、Qwen2-Audioを発表しました。これは、ASRなしの音声チャット、音・音楽・音声の分析、8言語以上をサポートする音声言語モデルの新バージョンです。Qwen2-Audio-7BとQwen2-Audio-7B-Instructモデルは、Hugging FaceとModelScopeで公開されています。パフォーマンスは複数のベンチマークで従来のSOTAを上回ります。
Alibabaは、音声とテキストの入力を受け取りテキストを生成できる、Qwen-Audioの次世代バージョンであるQwen2-Audioをリリースしました。ユーザーは初めて、ASR(自動音声認識)モジュールなしで音声コマンドを送信できるようになりました。このモデルは、テキスト指示に従って音声情報(発話、音、音楽)を分析でき、中国語、英語、広東語、フランス語、イタリア語、スペイン語、ドイツ語、日本語を含む8言語以上をサポートします。モデルウェイトのQwen2-Audio-7BとQwen2-Audio-7B-Instructは、Hugging FaceとModelScopeで公開されています。LibriSpeech、Common Voice 15、Fleurs、Aishell2、CoVoST2、Meld、Vocalsound、AIR-Benchmarkのベンチマークにおいて、Qwen2-Audioは以前のSOTA(最先端)およびQwen-Audioを大幅に上回っています。アーキテクチャは言語モデルQwenとオーディオエンコーダーに基づいており、トレーニングはマルチタスク事前学習、教師ありファインチューニング、および直接選好最適化(Direct Preference Optimization)を含みます。将来的には、より大規模なデータセットでのトレーニング、30秒以上のオーディオ対応、そしてより大規模なモデルが計画されています。
出典: Alibaba Qwen —
原文
