알리바바, Qwen2.5-VL-32B 오픈소스 공개: 더 똑똑하고 가볍게
Alibaba/Qwen
알리바바가 아파치 2.0 라이선스로 320억 개 파라미터의 비전-언어 모델 Qwen2.5-VL-32B-Instruct를 오픈소스로 공개했습니다. 이 모델은 Mistral-Small-3.1-24B 및 Gemma-3-27B-IT를 능가하며, MMMU 및 MathVista와 같은 멀티모달 추론 벤치마크에서 더 큰 Qwen2-VL-72B-Instruct를 뛰어넘습니다. 강화 학습을 통해 인간 정렬 및 수학적 추론을 최적화했습니다.
알리바바의 Qwen 팀이 Qwen2.5-VL-32B-Instruct를 출시했다고 발표했습니다. 이 모델은 320억 개의 파라미터를 가진 비전-언어 모델로, 아파치 2.0 라이선스 하에 오픈소스로 공개되었습니다. 이 모델은 Qwen2.5-VL 시리즈를 기반으로 하며 강화 학습을 통해 최적화되었습니다. 주요 개선 사항으로는 인간의 선호도에 더 잘 부합하는 응답, 향상된 수학적 추론 정확도, 세밀한 이미지 이해 및 추론 능력이 포함됩니다. 광범위한 벤치마킹에서 Qwen2.5-VL-32B-Instruct는 Mistral-Small-3.1-24B 및 Gemma-3-27B-IT와 같은 유사 규모의 최첨단 모델(SOTA, State-of-the-Art)을 능가하며, MMMU, MMMU-Pro, MathVista 같은 복잡한 멀티모달 작업에서는 더 큰 모델인 Qwen2-VL-72B-Instruct도 뛰어넘습니다. 또한 동일한 규모에서 순수 텍스트 능력에서도 최고 성능을 달성했습니다. 팀은 다음 단계로 고도로 복잡한 시각적 추론 작업을 위한 길고 효과적인 추론 프로세스에 초점을 맞출 계획입니다.
출처: Alibaba Qwen —
원문
