चीनी मॉडल SenseNova U1.5-Lite-Preview ने नेटिव 4K आउटपुट के साथ ओपन सोर्स किया

SenseTimeSenseTime
SenseTime ने SenseNova U1.5-Lite-Preview का प्रीव्यू और ओपन सोर्स किया है, जो एक हल्का नेटिव यूनिफाइड मल्टीमॉडल मॉडल है जो सीधे 4K इमेज जनरेट कर सकता है। यह जटिल प्रॉम्प्ट, रेफरेंस इमेज, मल्टी-इमेज कंपोज़िशन और सटीक एडिटिंग को सपोर्ट करता है, जो AI इमेज जनरेशन और एडिटिंग क्षमताओं में एक कदम आगे बढ़ाने का संकेत है।
सेंसटाइम (SenseTime) ने ओपन-सोर्स समुदाय के लिए एक हल्के, नेटिव यूनिफाइड मल्टीमॉडल मॉडल का शुरुआती प्रीव्यू, सेंसनोवा U1.5-Lite-Preview (SenseNova U1.5-Lite-Preview) रिलीज़ किया है। स्व-विकसित NEO-Unify आर्किटेक्चर पर बना यह मॉडल भाषा, विज़ुअल सिमेंटिक्स और पिक्सेल जनरेशन को एक ही फ्रेमवर्क के भीतर मॉडल करता है, जो विज़ुअल अंडरस्टैंडिंग, रीज़निंग, जनरेशन और एडिटिंग को कवर करता है। मात्र 8B-MoT पैरामीटर आकार के बावजूद, यह लंबे, बहु-बाध्यता (मल्टी-कॉन्स्ट्रेंट) वाले, स्तरीकृत (हायरार्किकल) और संरचित विज़ुअल निर्देशों को संभाल सकता है, जिससे यह पोस्टर और इन्फोग्राफिक्स जैसी उच्च-सूचना-घनत्व वाली सामग्री बनाने में माहिर है। मॉडल जनरेशन के बाद एडिटिंग को भी सपोर्ट करता है, जिसमें रेफरेंस इमेज, मल्टी-इमेज कंपोज़िशन, और रेड बॉक्स, कोऑर्डिनेट्स तथा मार्करों का उपयोग करते हुए सटीक लोकल एडिट शामिल हैं। इसने डिज़ाइन फ्रेमवर्क को दोहराने और अनुकूलित करने की क्षमता दिखाई, जैसे एक फ़िल्म-थीम वाले इन्फोग्राफिक को पोस्टल मेल जर्नी में बदलना, और एकल कैरेक्टर में बदलाव करना, जैसे विज़ुअल तत्वों को पुनर्गठित करके '迎' को '命' में बदलना। मॉडल कई रेफरेंस इमेज को भी जोड़ सकता है, जैसे किसी असली फोटो को हाथ से बनाई गई रेसिपी में या किसी पोर्ट्रेट को एक-पेज के रिज़्यूमे में बदलना। सेंसनोवा (SenseNova) ने जनरेशन हेड को फिर से डिज़ाइन करते हुए नेटिव रेज़ोल्यूशन को 4K तक बढ़ा दिया है, जिससे ग्रिड आर्टिफ़ैक्ट्स कम हुए हैं और टेक्सचर डिटेल में सुधार हुआ है। बेंचमार्क पर परफॉर्मेंस में सुधार देखा गया: Qwen-Image-Bench स्कोर 47.14 से 55.20 हो गया, ImgEdit-Bench 3.90 से 4.37 हो गया, और GEdit-Bench अंग्रेज़ी में 7.47 से 8.17 तथा चीनी में 7.42 से 8.05 हो गया, जबकि WeEdit ओवरऑल एवरेज 6.44 रहा। U1.5 का आधिकारिक संस्करण जल्द ही ओपन-सोर्स किए जाने की उम्मीद है। लिंक GitHub, Hugging Face, और ModelScope पर उपलब्ध कराए गए हैं।
स्रोत: QbitAI 量子位 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार