알리바바, Qwen2-Audio 출시: 음성 채팅 및 분석 기능을 갖춘 새로운 오디오 언어 모델
Alibaba/Qwen
알리바바가 Qwen2-Audio를 공개했습니다. 이는 음성 채팅(ASR 없이), 소리, 음악 및 음성 분석, 8개 이상의 언어를 지원하는 새로운 오디오 언어 모델입니다. Qwen2-Audio-7B 및 Qwen2-Audio-7B-Instruct 모델이 Hugging Face와 ModelScope에 공개되었습니다. 성능은 여러 벤치마크에서 기존 최고 성능(SOTA)을 능가합니다.
알리바바가 Qwen-Audio의 차기 버전인 Qwen2-Audio를 출시했습니다. 이 모델은 오디오와 텍스트 입력을 받아 텍스트를 생성할 수 있습니다. 이번이 처음으로 사용자가 별도의 음성 인식(ASR) 모듈 없이 음성 명령을 내릴 수 있게 되었습니다. 이 모델은 텍스트 명령어에 따라 오디오 정보(음성, 소리, 음악)를 분석할 수 있으며, 중국어, 영어, 광둥어, 프랑스어, 이탈리아어, 스페인어, 독일어, 일본어 등 8개 이상의 언어를 지원합니다. Qwen2-Audio-7B와 Qwen2-Audio-7B-Instruct 모델의 가중치는 Hugging Face와 ModelScope에 공개되었습니다. LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound, AIR-Benchmark 등 벤치마크에서 Qwen2-Audio는 이전 최고 성능(SOTA)과 Qwen-Audio를 크게 앞질렀습니다. 아키텍처는 Qwen 언어 모델과 오디오 인코더를 기반으로 하며, 학습에는 멀티태스크 사전 학습(멀티태스크 프리트레인), 지도 학습 미세 조정(supervised finetuning), 직접 선호도 최적화(direct preference optimization)가 포함됩니다. 향후에는 더 큰 데이터셋으로 학습하고, 30초 이상의 오디오를 지원하며, 더 큰 모델을 개발할 계획입니다.
출처: Alibaba Qwen —
원문
