Qwen2-VL: Alibaba ने SoTA प्रदर्शन के साथ विज़न-लैंग्वेज मॉडल की नई पीढ़ी जारी की
Alibaba/Qwen
Alibaba ने Qwen2-VL पेश किया है - विज़न-लैंग्वेज मॉडल की नई पीढ़ी, जो छवियों, वीडियो और मल्टीमॉडल एजेंट क्षमताओं की समझ में अपने पूर्ववर्ती से काफी बेहतर है। 2B और 7B मॉडल Apache 2.0 लाइसेंस के तहत ओपन-सोर्स हैं, जबकि 72B API के माध्यम से उपलब्ध है। Qwen2-VL-72B कई बेंचमार्क्स पर GPT-4o और Claude 3.5-Sonnet से बेहतर प्रदर्शन करता है, खासकर दस्तावेज़ समझ में।
Alibaba ने Qwen2-VL जारी किया, जो Qwen2 पर आधारित vision-language मॉडल की एक नई पीढ़ी है। 2B और 7B मॉडल Apache 2.0 लाइसेंस के तहत खुले हैं, जबकि 72B API के माध्यम से उपलब्ध है। Qwen2-VL MathVista, DocVQA, RealWorldQA, MTVQA बेंचमार्क पर state-of-the-art परिणाम प्राप्त करता है। यह मॉडल 20 मिनट से अधिक लंबे वीडियो को समझने और स्वचालित संचालन के लिए उपकरणों के साथ एकीकृत होने में सक्षम है। यह यूरोपीय भाषाओं, जापानी, कोरियाई, अरबी, वियतनामी सहित बहुभाषीयता का समर्थन करता है। Qwen2-VL 600 मिलियन पैरामीटर वाले Vision Transformer का उपयोग करता है और डायनामिक रिज़ॉल्यूशन का समर्थन करता है। टेक्स्ट, विज़ुअल और वीडियो जानकारी को एक साथ कैप्चर करने के लिए मल्टीमॉडल पोजीशनल एम्बेडिंग M-ROPE पेश की गई है। यह मॉडल दस्तावेज़ समझने और समस्या समाधान में GPT-4o और Claude 3.5-Sonnet से बेहतर प्रदर्शन दिखाता है। मॉडल की सीमाएँ: वीडियो से ऑडियो निकालने की कमी, जून 2023 तक का ज्ञान, गिनती और वर्ण पहचान में कठिनाइयाँ।
स्रोत: Alibaba Qwen —
मूल
