Alibaba、音声チャットと分析機能を備えた新オーディオ言語モデルQwen2-Audioをリリース
Alibaba/Qwen
Alibabaは、ASRなしの音声チャット、音・音楽・音声の分析、8以上の言語をサポートする新バージョンのオーディオ言語モデルQwen2-Audioを発表しました。Qwen2-Audio-7BおよびQwen2-Audio-7B-InstructモデルはHugging FaceとModelScopeで公開されています。性能は複数のベンチマークで従来のSOTAを上回っています。
Alibabaは、音声とテキストの入力を受け取りテキストを生成できる、Qwen-Audioの次世代バージョンであるQwen2-Audioをリリースしました。ユーザーは初めて、ASR(自動音声認識)モジュールなしで音声コマンドを送信できるようになりました。このモデルは、テキスト指示に従って音声情報(発話、音、音楽)を分析でき、中国語、英語、広東語、フランス語、イタリア語、スペイン語、ドイツ語、日本語を含む8言語以上をサポートします。モデルウェイトのQwen2-Audio-7BとQwen2-Audio-7B-Instructは、Hugging FaceとModelScopeで公開されています。LibriSpeech、Common Voice 15、Fleurs、Aishell2、CoVoST2、Meld、Vocalsound、AIR-Benchmarkのベンチマークにおいて、Qwen2-Audioは以前のSOTA(最先端)およびQwen-Audioを大幅に上回っています。アーキテクチャは言語モデルQwenとオーディオエンコーダーに基づいており、トレーニングはマルチタスク事前学習、教師ありファインチューニング、および直接選好最適化(Direct Preference Optimization)を含みます。将来的には、より大規模なデータセットでのトレーニング、30秒以上のオーディオ対応、そしてより大規模なモデルが計画されています。
出典: Alibaba Qwen —
原文
