Qwen2-VL:阿里巴巴发布新一代视觉语言模型,性能达到SoTA
Alibaba/Qwen
阿里巴巴发布了Qwen2-VL,这是新一代视觉语言模型,在图像理解、视频处理和多功能代理能力方面显著超越前代。2B和7B模型在Apache 2.0许可证下开源,72B模型可通过API获取。Qwen2-VL-72B在多个基准测试中表现出超越GPT-4o和Claude 3.5 Sonnet的性能,尤其在文档理解方面。
阿里巴巴发布了Qwen2-VL,这是基于Qwen2的新一代视觉语言模型。2B和7B模型在Apache 2.0许可下开源,而72B模型可通过API使用。Qwen2-VL在MathVista、DocVQA、RealWorldQA、MTVQA等基准测试中取得了最先进的成果。该模型能够理解超过20分钟的视频,并能与设备集成进行自动化操作。支持多语言,包括欧洲语言、日语、韩语、阿拉伯语、越南语。Qwen2-VL使用包含6亿参数的视觉变换器(Vision Transformer),并支持动态分辨率。引入了多模态位置嵌入M-ROPE,以同时捕捉文本、视觉和视频信息。该模型在文档理解和问题解决方面表现出色,超越了GPT-4o和Claude 3.5-Sonnet。模型局限性包括:无法从视频中提取音频、知识截止于2023年6月、在计数和符号识别方面存在困难。
来源: Alibaba Qwen —
原文
