Qwen2-VL: Alibaba ने SoTA प्रदर्शन के साथ विज़न-भाषा मॉडल की नई पीढ़ी जारी की
Alibaba/Qwen
Alibaba ने Qwen2-VL पेश किया है - विज़न-भाषा मॉडल की नई पीढ़ी, जो छवियों, वीडियो और मल्टीमॉडल एजेंट क्षमताओं को समझने में अपने पूर्ववर्ती से काफी बेहतर प्रदर्शन करती है। 2B और 7B मॉडल Apache 2.0 लाइसेंस के तहत ओपन-सोर्स हैं, जबकि 72B API के माध्यम से उपलब्ध है। Qwen2-VL-72B कई बेंचमार्कों, विशेषकर दस्तावेज़ समझ में, GPT-4o और Claude 3.5-Sonnet से बेहतर प्रदर्शन दर्शाता है।
Alibaba ने Qwen2-VL जारी किया, जो Qwen2 पर आधारित vision-language मॉडल की एक नई पीढ़ी है। 2B और 7B मॉडल Apache 2.0 लाइसेंस के तहत खुले हैं, जबकि 72B API के माध्यम से उपलब्ध है। Qwen2-VL MathVista, DocVQA, RealWorldQA, MTVQA बेंचमार्क पर state-of-the-art परिणाम प्राप्त करता है। यह मॉडल 20 मिनट से अधिक लंबे वीडियो को समझने और स्वचालित संचालन के लिए उपकरणों के साथ एकीकृत होने में सक्षम है। यह यूरोपीय भाषाओं, जापानी, कोरियाई, अरबी, वियतनामी सहित बहुभाषीयता का समर्थन करता है। Qwen2-VL 600 मिलियन पैरामीटर वाले Vision Transformer का उपयोग करता है और डायनामिक रिज़ॉल्यूशन का समर्थन करता है। टेक्स्ट, विज़ुअल और वीडियो जानकारी को एक साथ कैप्चर करने के लिए मल्टीमॉडल पोजीशनल एम्बेडिंग M-ROPE पेश की गई है। यह मॉडल दस्तावेज़ समझने और समस्या समाधान में GPT-4o और Claude 3.5-Sonnet से बेहतर प्रदर्शन दिखाता है। मॉडल की सीमाएँ: वीडियो से ऑडियो निकालने की कमी, जून 2023 तक का ज्ञान, गिनती और वर्ण पहचान में कठिनाइयाँ।
स्रोत: Alibaba Qwen —
मूल
