阿里发布Qwen2-Audio:支持语音聊天和音频分析的新型音频语言模型
Alibaba/Qwen
阿里巴巴发布了Qwen2-Audio,这是音频语言模型的新版本,支持无需自动语音识别的语音聊天、声音、音乐和语音分析,以及超过8种语言。Qwen2-Audio-7B和Qwen2-Audio-7B-Instruct模型已在Hugging Face和ModelScope上开源。在多个基准测试中,其性能超越了之前的SOTA模型。
阿里巴巴发布了Qwen2-Audio,这是Qwen-Audio的下一代版本,能够接收音频和文本输入并生成文本。用户首次可以在没有ASR模块的情况下直接发出语音指令。该模型能够根据文本指令分析音频信息(包括语音、声音和音乐),并支持超过8种语言,包括中文、英语、粤语、法语、意大利语、西班牙语、德语和日语。Qwen2-Audio-7B和Qwen2-Audio-7B-Instruct模型的权重已在Hugging Face和ModelScope上开源。在LibriSpeech、Common Voice 15、Fleurs、Aishell2、CoVoST2、Meld、Vocalsound和AIR-Benchmark等基准测试中,Qwen2-Audio的表现显著优于之前的SOTA和Qwen-Audio。其架构基于Qwen语言模型和音频编码器,训练过程包括多任务预训练、监督微调和直接偏好优化。未来计划在大数据集上进行训练,支持超过30秒的音频,并推出更大规模的模型。
来源: Alibaba Qwen —
原文
