中国模型SenseNova U1.5-Lite-Preview开源,原生支持4K输出
SenseTime
商汤科技预览并开源了SenseNova U1.5-Lite-Preview,这是一个轻量级的原生统一多模态模型,能够直接生成4K图像。它支持复杂提示词、参考图像、多图像合成及精准编辑,标志着人工智能图像生成与编辑能力迈出重要一步。
商汤科技向开源社区发布了SenseNova U1.5-Lite-Preview,这是轻量级原生统一多模态模型的早期预览版。该模型基于自研的NEO-Unify架构,在单一框架内对语言、视觉语义和像素生成进行建模,涵盖视觉理解、推理、生成和编辑。尽管其参数量仅为8B-MoT(80亿参数),却能处理长指令、多约束、层次化和结构化的视觉指令,擅长制作海报和信息图等高信息密度内容。该模型还支持生成后编辑,包括参考图像、多图像合成以及使用红框、坐标和标记进行精确局部编辑。它展示了复制和改编设计框架的能力,例如将电影主题的信息图转换为邮政邮递流程,以及通过重新组织视觉元素来修改单个字符,如将“迎”改为“命”。该模型还能结合多个参考图像,将真实照片转换为手绘食谱,或将肖像转换为一页简历。SenseNova重新设计了生成头部,将原生分辨率提升至4K,减少了网格伪影并改善了纹理细节。在基准测试中性能有所提升:Qwen-Image-Bench得分从47.14升至55.20,ImgEdit-Bench从3.90升至4.37,GEdit-Bench英文从7.47升至8.17,中文从7.42升至8.05,以及WeEdit总体平均得分为6.44。U1.5正式版预计即将开源。相关链接已在GitHub、Hugging Face和ModelScope上提供。
来源: QbitAI 量子位 —
原文
