मॉडलओपन सोर्स 🇨🇳 28.07.2026 16:03

Alibaba ने लॉन्च किया Qwen2.5-VL: नया फ्लैगशिप मल्टीमॉडल मॉडल

Alibaba/QwenAlibaba/Qwen
Alibaba ने Qwen2.5-VL पेश किया — विज़न-लैंग्वेज मॉडल की नई पीढ़ी, जो 3B, 7B और 72B आकारों में उपलब्ध है। यह मॉडल बेहतर विज़ुअल समझ, एक घंटे से अधिक लंबे वीडियो के लिए समर्थन, एजेंट क्रियाओं और संरचित आउटपुट की क्षमता रखता है।
Alibaba की Qwen टीम ने Qwen2.5-VL जारी किया है — एक नया फ्लैगशिप विज़न-लैंग्वेज मॉडल। यह तीन आकारों में उपलब्ध है: 3B, 7B और 72B, बेस और इंस्ट्रक्ट दोनों वर्जन, Hugging Face और ModelScope पर। मॉडल वस्तुओं, टेक्स्ट, डायग्राम को पहचान सकता है, और एक विज़ुअल एजेंट के रूप में भी काम कर सकता है: कंप्यूटर या फोन को नियंत्रित करना। यह एक घंटे से अधिक लंबे वीडियो को समझता है और समय के अनुसार घटनाओं का पता लगाने में सक्षम है। मॉडल बाउंडिंग बॉक्स और की-पॉइंट के साथ सटीक स्थानीयकरण का समर्थन करता है, साथ ही दस्तावेज़ों, बिलों और तालिकाओं के लिए JSON में संरचित आउटपुट भी देता है। फ्लैगशिप Qwen2.5-VL-72B-Instruct बेंचमार्क पर प्रतिस्पर्धी परिणाम दिखाता है, जिसमें कॉलेज-स्तरीय कार्य, गणित, दस्तावेज़ और वीडियो समझना शामिल है। छोटे वर्जन (7B) कई कार्यों में GPT-4o-mini से बेहतर प्रदर्शन करते हैं, और 3B, जो एज आर्टिफिशियल इंटेलिजेंस के लिए डिज़ाइन किया गया है, पिछले 7B मॉडल को पीछे छोड़ देता है। इमेज रिकॉग्निशन में भी सुधार हुआ है: अब मॉडल पौधों, जानवरों, पर्यटन स्थलों, फिल्म पात्रों और उत्पादों सहित बड़ी संख्या में श्रेणियों को कवर करता है। मॉडल दस्तावेज़ों को चिह्नित करने के लिए HTML फ़ॉर्मेट का उपयोग करता है (QwenVL HTML)।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार