中国のモデルSenseNova U1.5-Lite-Previewがオープンソース化、ネイティブ4K出力に対応
SenseTime
商湯科技(SenseTime)は、軽量なネイティブ統合マルチモーダルモデル「SenseNova U1.5-Lite-Preview」をプレビューし、オープンソース化しました。このモデルは、4K画像を直接生成でき、複雑なプロンプト、参照画像、複数画像の合成、精密な編集をサポートします。AIによる画像生成と編集の能力における一歩前進を示しています。
商汤科技向开源社区发布了SenseNova U1.5-Lite-Preview,这是一个轻量级原生统一多模态模型的早期预览版本。该模型基于自研的NEO-Unify架构,在单一框架内对语言、视觉语义和像素生成进行建模,涵盖视觉理解、推理、生成和编辑。尽管参数量仅有8B-MoT,却能处理长指令、多约束、分层和结构化的视觉指令,擅长制作海报和信息图等高信息密度内容。模型还支持生成后的编辑,包括参考图像、多图合成以及使用红框、坐标和标记进行精确的局部编辑。它展示了复制和改编设计框架的能力,例如将电影主题的信息图转换为一封邮政邮件之旅,以及通过重新组织视觉元素来修改单个字符,如将“迎”改为“命”。该模型还能组合多张参考图像,将真实照片转化为手绘菜谱,或将肖像转化为一页简历。SenseNova重新设计了生成头部,将原生分辨率提升至4K,减少了网格伪影并改善了纹理细节。基准测试性能有所提升:Qwen-Image-Bench得分从47.14上升到55.20,ImgEdit-Bench从3.90上升到4.37,GEdit-Bench英文从7.47上升到8.17,中文从7.42上升到8.05,WeEdit总体平均得分为6.44。U1.5正式版预计将很快开源。GitHub、Hugging Face和ModelScope上提供了链接。
出典: QbitAI 量子位 —
原文
