阿里巴巴通义千问发布QVQ-Max:具备推理能力的视觉推理模型
Alibaba/Qwen
阿里巴巴通义千问正式发布QVQ-Max,这是其首个版本的视觉推理模型。该模型不仅能识别图像和视频,还能进行分析、推理并提供解决方案。在MathVision基准测试中,QVQ-Max展现出随思考过程长度增加而持续提升的准确性。
阿里巴巴的Qwen推出了其首个视觉推理模型QVQ-Max。该模型能够基于图像和视频进行分析与推理,解决从数学问题到日常生活的各类任务。在包含多样化多模态数学任务的MathVision基准测试中,随着最大思维链长度的增加,QVQ-Max的准确率得到提升。模型的关键能力包括细致观察、深度推理和灵活应用。应用场景涵盖工作、学习和日常生活的辅助。未来计划包括提高识别精度、执行多步骤任务以及与其他模态的交互。
来源: Alibaba Qwen —
原文
