模型媒体生成 🇨🇳 27.07.2026 18:04

阿里发布统一多模态理解与生成模型Qwen VLo

Alibaba/QwenAlibaba/Qwen
阿里巴巴发布Qwen VLo,这是一个统一的多模态模型,既能理解图像也能生成图像。它支持开放式编辑、多语言指令、动态分辨率以及从上到下、从左到右的渐进式生成。该模型现已在Qwen Chat上提供预览。
阿里推出Qwen VLo,这是一款全新的统一多模态模型,既能理解图像也能生成图像。该模型是此前QwenVL系列(即“千问视觉语言”系列)的升级版本,将感知与创作融为一体。它采用渐进式生成方法,从左到右、从上到下逐步构建图像。Qwen VLo支持精准内容理解、开放式指令编辑(如风格迁移、物体修改、背景变更)、多语言指令(中文和英文),以及动态分辨率与任意宽高比。此外,它还能通过编辑指令执行视觉感知任务,例如深度图预测、分割和边缘检测。该模型处于预览阶段,可通过Qwen Chat(即“千问聊天”)使用。其局限性包括偶尔出现的不准确性和不一致性。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻