Alibaba ने Qwen-Image जारी किया: टेक्स्ट-सटीक इमेज जनरेशन के लिए 20B MMDiT मॉडल
Alibaba/Qwen
Alibaba की Qwen टीम ने Qwen-Image जारी किया है, जो एक 20-बिलियन-पैरामीटर MMDiT इमेज फाउंडेशन मॉडल है। यह जटिल टेक्स्ट रेंडरिंग (जिसमें द्विभाषी चीनी-अंग्रेजी शामिल है), सुसंगत इमेज एडिटिंग, और GenEval तथा DPG जैसे बेंचमार्क्स पर मजबूत प्रदर्शन में उत्कृष्ट है। मॉडल पोस्टर निर्माण, स्लाइड जनरेशन और छोटे क्षेत्रों पर सटीक टेक्स्ट रेंडरिंग का समर्थन करता है।
अलीबाबा के Qwen टीम ने Qwen-Image जारी किया है, जो 20 बिलियन पैरामीटर वाला MMDiT इमेज फाउंडेशन मॉडल है। यह GenEval, DPG, OneIG-Bench जैसे जनरेशन बेंचमार्क, GEdit, ImgEdit, GSO जैसे एडिटिंग बेंचमार्क, और LongText-Bench, ChineseWord, TextCraft जैसे टेक्स्ट रेंडरिंग बेंचमार्क पर सर्वश्रेष्ठ परिणाम प्राप्त करता है। यह मॉडल वर्णमाला आधारित भाषाओं (जैसे अंग्रेज़ी) और लॉगोग्राफिक भाषाओं (जैसे चीनी) में जटिल मल्टी-लाइन टेक्स्ट को रेंडर करने में उत्कृष्ट है, जिसमें हस्तलिखित टेक्स्ट, पोस्टर, पीपीटी स्लाइड्स और द्विभाषी सामग्री शामिल है। यह स्टाइल ट्रांसफर, ऑब्जेक्ट जोड़ना/हटाना और टेक्स्ट एडिटिंग जैसे सुसंगत इमेज एडिटिंग ऑपरेशन का भी समर्थन करता है। यह मॉडल छोटे टेक्स्ट को सटीक रूप से रेंडर कर सकता है, जैसे कागज पर एक पैराग्राफ जो इमेज के दसवें हिस्से से कम जगह घेरता है। Qwen-Image Qwen Chat और GitHub, Hugging Face तथा ModelScope जैसे प्लेटफ़ॉर्म पर उपलब्ध है।
स्रोत: Alibaba Qwen —
मूल
