模型开源 🇨🇳 28.07.2026 16:03

阿里巴巴发布 Qwen2.5-VL:全新旗舰多模态模型

Alibaba/QwenAlibaba/Qwen
阿里巴巴推出了 Qwen2.5-VL,新一代视觉语言模型,提供 3B、7B 和 72B 三种规模。该模型在视觉理解方面有所改进,支持超过一小时的视频,具备代理操作能力和结构化输出功能。
阿里巴巴Qwen团队发布了Qwen2.5-VL——全新的视觉语言旗舰模型。该模型提供3B、7B和72B三种尺寸,包含基础版和指令版,可在Hugging Face和ModelScope获取。模型能识别物体、文本、图表,并可作为视觉智能体使用:操控电脑或手机。它理解时长超过一小时的视频,并能定位事件发生的时间点。模型支持通过边界框和关键点进行精准物体定位,还能以JSON格式结构化输出文档、发票和表格。旗舰版Qwen2.5-VL-72B-Instruct在多项基准测试中表现优异,涵盖大学级题目、数学、文档理解和视频任务。小尺寸版本(7B)在多项任务上超越GPT-4o-mini,而面向边缘人工智能的3B版本则超越了前代7B模型。图像识别能力也得到提升:如今模型覆盖海量类别,包括植物、动物、地标、电影角色和商品。模型采用HTML格式进行文档标注(QwenVL HTML)。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻