모델연구 🇨🇳 28.07.2026 19:03

Qwen2-VL: 알리바바, 최첨단 성능의 차세대 비전-언어 모델 출시

Alibaba/QwenAlibaba/Qwen
알리바바가 Qwen2-VL을 공개했습니다. 이는 이미지, 비디오 이해 및 멀티모달 에이전트 기능에서 전작을 크게 능가하는 차세대 비전-언어 모델입니다. 2B와 7B 모델은 Apache 2.0 라이선스로 오픈소스 제공되며, 72B 모델은 API를 통해 사용할 수 있습니다. Qwen2-VL-72B는 많은 벤치마크, 특히 문서 이해에서 GPT-4o와 Claude 3.5-Sonnet를 능가하는 성능을 보여줍니다.
알리바바가 Qwen2 기반의 새로운 비전-언어 모델인 Qwen2-VL을 출시했습니다. 2B 및 7B 모델은 Apache 2.0 라이선스로 공개되었으며, 72B 모델은 API를 통해 사용할 수 있습니다. Qwen2-VL은 MathVista, DocVQA, RealWorldQA, MTVQA 벤치마크에서 최첨단 성능을 달성했습니다. 이 모델은 20분 이상 길이의 동영상을 이해하고 자동 작업을 위해 기기와 통합될 수 있습니다. 유럽 언어, 일본어, 한국어, 아랍어, 베트남어를 포함한 다국어를 지원합니다. Qwen2-VL은 6억 개의 파라미터를 가진 Vision Transformer를 사용하며 동적 해상도를 지원합니다. 텍스트, 시각, 비디오 정보를 동시에 캡처하기 위해 다중 모달 위치 임베딩 M-ROPE가 도입되었습니다. 이 모델은 문서 이해와 작업 해결에서 GPT-4o 및 Claude 3.5-Sonnet을 능가하는 우수성을 보여줍니다. 모델의 한계로는 동영상에서 오디오 추출 불가, 지식이 2023년 6월까지로 제한됨, 계산 및 문자 인식의 어려움이 있습니다.
출처: Alibaba Qwen — 원문
관련 게시물 ↓
새로운 뉴스