एलिबाबा ने Qwen2.5-VL-32B को ओपन-सोर्स किया: ज्यादा स्मार्ट और हल्का
Alibaba/Qwen
एलिबाबा ने Qwen2.5-VL-32B-Instruct को Apache 2.0 लाइसेंस के तहत ओपन-सोर्स किया है, जो 32 बिलियन पैरामीटर वाला एक विज़न-लैंग्वेज मॉडल है। यह Mistral-Small-3.1-24B और Gemma-3-27B-IT से बेहतर प्रदर्शन करता है, और यहाँ तक कि बड़े Qwen2-VL-72B-Instruct को भी MMMU और MathVista जैसे मल्टीमॉडल रीज़निंग बेंचमार्क पर पीछे छोड़ देता है। मॉडल को बेहतर मानव संरेखण और गणितीय तर्क के लिए रीइन्फोर्समेंट लर्निंग के माध्यम से अनुकूलित किया गया है।
अलीबाबा की Qwen टीम ने Qwen2.5-VL-32B-Instruct के रिलीज़ की घोषणा की, जो 32 बिलियन पैरामीटर वाला एक विज़न-लैंग्वेज मॉडल है, जिसे Apache 2.0 के तहत ओपन-सोर्स किया गया है। यह मॉडल Qwen2.5-VL श्रृंखला पर आधारित है और इसे रीइन्फोर्समेंट लर्निंग का उपयोग करके अनुकूलित किया गया है। मुख्य सुधारों में मानवीय प्राथमिकताओं के साथ अधिक संरेखित प्रतिक्रियाएँ, बेहतर गणितीय तर्क सटीकता, और सूक्ष्म स्तर की छवि समझ और तर्क शामिल हैं। व्यापक बेंचमार्किंग में, Qwen2.5-VL-32B-Instruct समान पैमाने के SoTA मॉडलों जैसे Mistral-Small-3.1-24B और Gemma-3-27B-IT से बेहतर प्रदर्शन करता है, और जटिल मल्टीमॉडल कार्यों जैसे MMMU, MMMU-Pro, और MathVista में बड़े Qwen2-VL-72B-Instruct को भी पीछे छोड़ देता है। यह समान पैमाने पर शुद्ध टेक्स्ट क्षमताओं में भी शीर्ष स्तर का प्रदर्शन प्राप्त करता है। टीम अब अत्यधिक जटिल विज़ुअल रीज़निंग कार्यों के लिए लंबी और प्रभावी तर्क प्रक्रियाओं पर ध्यान केंद्रित करने की योजना बना रही है।
स्रोत: Alibaba Qwen —
मूल
