阿里巴巴发布Qwen-Image:20B参数的MMDiT模型,实现文字精准图像生成
Alibaba/Qwen
阿里巴巴通义千问团队发布了Qwen-Image,这是一个200亿参数的MMDiT图像基础模型,在复杂文本渲染(包括中英双语)、一致的图像编辑以及GenEval、DPG等基准测试中表现出色。该模型支持海报创作、幻灯片生成以及小区域内的精确文本渲染。
阿里巴巴通义千问团队发布了Qwen-Image,这是一个拥有200亿参数的MMDiT图像基础模型。该模型在GenEval、DPG、OneIG-Bench(图像生成)、GEdit、ImgEdit、GSO(图像编辑)以及LongText-Bench、ChineseWord、TextCraft(文字渲染)等基准测试中均达到了领先水平。它擅长渲染复杂的多行文字,包括字母语言(如英语)和表意语言(如中文),涵盖手写文字、海报、PPT幻灯片以及双语内容。此外,该模型还支持一致的图像编辑操作,如风格迁移、对象添加/删除和文字编辑,并能准确渲染微小文字——例如,一张图片中占据不到十分之一面积的纸张上的段落。Qwen-Image现已通过通义千问的聊天平台以及GitHub、Hugging Face和ModelScope等平台提供。
来源: Alibaba Qwen —
原文
