النموذج الصيني SenseNova U1.5-Lite-Preview يصبح مفتوح المصدر مع إخراج 4K الأصلي
SenseTime
استعرضت شركة SenseTime وأصدرت نموذج SenseNova U1.5-Lite-Preview كمفتوح المصدر، وهو نموذج متعدد الوسائط موحد خفيف الوزن يمكنه توليد صور بدقة 4K مباشرة. يدعم النموذج المطالبات المعقدة والصور المرجعية وتركيب الصور المتعددة والتحرير الدقيق، مما يمثل خطوة إلى الأمام في قدرات توليد وتحرير الصور بالذكاء الاصطناعي.
أطلقت شركة SenseTime نموذج SenseNova U1.5-Lite-Preview، وهو نسخة تجريبية مبكرة من نموذج خفيف الوزن أصلي موحّد متعدد الوسائط (Multimodal)، لمجتمع المصادر المفتوحة. وبُني هذا النموذج على معمارية NEO-Unify المطوَّرة داخليًا، والتي تُصمِّم اللغة والدلالات البصرية وتوليد البكسل ضمن إطار عمل واحد، بما يشمل الفهم البصري والاستدلال والتوليد والتحرير. وعلى الرغم من صغر حجم معاملاته البالغ 8 مليارات (بمعمارية خليط الخبراء عبر الزمن MoT، أي Mixture-of-Transformers)، فإنه قادر على التعامل مع التعليمات البصرية الطويلة ومتعددة القيود والهرمية والمُهيكَلة، ما يجعله بارعًا في إنشاء محتوى ذي كثافة معلوماتية عالية مثل الملصقات والرسوم البيانية التوضيحية (إنفوغرافيك).
يدعم النموذج أيضًا التحرير بعد التوليد، بما في ذلك استخدام صور مرجعية، ودمج صور متعددة، والتحرير الموضعي الدقيق باستخدام المربعات الحمراء والإحداثيات والعلامات. وأظهر النموذج قدرته على نسخ وتكييف أطر التصميم، مثل تحويل رسم بيانية بموضوع سينمائي إلى مسار رحلة بريدية، وتعديل حرف مفرد مثل تحويل '迎' إلى '命' عن طريق إعادة تنظيم العناصر البصرية. كما يمكن للنموذج دمج عدة صور مرجعية معًا، كتحويل صورة فوتوغرافية حقيقية إلى وصفة طعام مرسومة باليد، أو تحويل صورة شخصية إلى سيرة ذاتية من صفحة واحدة.
أعادت SenseNova تصميم رأس التوليد (Generation Head) لرفع الدقة الأصلية إلى مستوى 4K، مما قلّل من عيوب الشبكة (Grid Artifacts) وحسّن تفاصيل النسيج البصري. وتحسّن الأداء على معايير القياس المرجعية: ارتفعت نتيجة Qwen-Image-Bench من 47.14 إلى 55.20، ونتيجة ImgEdit-Bench من 3.90 إلى 4.37، ونتيجة GEdit-Bench بالإنجليزية من 7.47 إلى 8.17، وبالصينية من 7.42 إلى 8.05، مع متوسط عام لمعيار WeEdit بلغ 6.44.
ومن المتوقع أن يُطرح الإصدار الرسمي من U1.5 كمصدر مفتوح قريبًا. وقد وُفّرت روابط الوصول إليه على منصات GitHub وHugging Face وModelScope.
المصدر: QbitAI 量子位 —
الأصلي
