⚡ 속보
Qwen2.5 Omni: 보고, 듣고, 말하고, 쓰는 올인원 모델
Alibaba/Qwen
알리바바 Qwen이 플래그십 멀티모달 모델인 Qwen2.5-Omni를 공개했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오를 처리할 수 있을 뿐만 아니라 실시간 음성 생성도 가능합니다. Thinker-Talker 아키텍처를 사용하며, 모든 양식에서 유사 모델들을 능가합니다.
알리바바 Qwen이 Qwen2.5-Omni를 공개했습니다. 이는 포괄적인 다중 모달 인식을 위해 설계된 Qwen 시리즈의 새로운 플래그십 모델입니다. 이 모델은 텍스트, 이미지, 오디오, 비디오를 처리하며 텍스트나 자연스러운 음성 형태로 스트리밍 응답을 생성합니다. Thinker-Talker 아키텍처는 입력을 이해하는 Thinker와 음성을 생성하는 Talker로 구성됩니다. 이 모델은 Hugging Face, ModelScope, DashScope, GitHub에서 사용할 수 있습니다. Qwen2.5-Omni는 오디오 작업에서 Qwen2.5-VL-7B 및 Qwen2-Audio보다 뛰어난 성능을 보이며, 비디오 및 이미지에서는 비슷한 성능을, OmniBench에서는 최첨단 결과를 달성했습니다. 또한 음성 인식, 번역, 오디오 이해, 음성 생성에서 높은 정확도를 보여줍니다. 향후 계획에는 음성 명령에 대한 대응 개선과 더 많은 모달리티 통합이 포함됩니다.
출처: Alibaba Qwen —
원문
