Alibaba का Qwen VLo: एकीकृत मल्टीमॉडल समझ और उत्पादन मॉडल
Alibaba/Qwen
Alibaba ने Qwen VLo जारी किया, एक एकीकृत मल्टीमॉडल मॉडल जो छवियों को समझता और उत्पन्न करता है। यह ओपन-एंडेड संपादन, बहुभाषी निर्देश, डायनामिक रिज़ॉल्यूशन और ऊपर से नीचे तथा बाएं से दाएं प्रगतिशील निर्माण का समर्थन करता है। Qwen Chat पर पूर्वावलोकन के रूप में उपलब्ध।
अलीबाबा ने Qwen VLo पेश किया, एक नया एकीकृत मल्टीमॉडल मॉडल जो छवियों को समझने और उत्पन्न करने दोनों में सक्षम है। यह मॉडल पिछली QwenVL श्रृंखला का उन्नयन है, जो धारणा और सृजन के बीच की खाई को पाटता है। यह एक क्रमिक उत्पादन विधि का उपयोग करता है, जहां छवियों को बाएं से दाएं और ऊपर से नीचे तक धीरे-धीरे बनाया जाता है। Qwen VLo सटीक सामग्री समझ, ओपन-एंडेड निर्देश-आधारित संपादन (स्टाइल ट्रांसफर, ऑब्जेक्ट संशोधन, पृष्ठभूमि बदलना), बहुभाषी निर्देश (चीनी और अंग्रेजी), और गतिशील रिज़ॉल्यूशन के साथ मनमानी पहलू अनुपात का समर्थन करता है। यह संपादन कमांड के माध्यम से डेप्थ मैप भविष्यवाणी, सेगमेंटेशन और एज डिटेक्शन जैसे विज़ुअल परसेप्शन कार्य भी कर सकता है। मॉडल प्रीव्यू चरण में है और Qwen Chat के माध्यम से उपलब्ध है। सीमाओं में सामयिक अशुद्धियाँ और असंगतताएँ शामिल हैं।
स्रोत: Alibaba Qwen —
मूल
