मॉडलशोध 🇨🇳 28.07.2026 00:03

Alibaba Qwen ने जारी किया QVQ-Max: साक्ष्य सहित दृश्य तर्क मॉडल

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ने आधिकारिक तौर पर QVQ-Max जारी किया है, जो इसके दृश्य तर्क मॉडल का पहला संस्करण है। यह न केवल चित्रों और वीडियो को पहचान सकता है, बल्कि उनका विश्लेषण भी कर सकता है, गणित से लेकर रचनात्मकता तक के कार्यों को हल कर सकता है। डेवलपर्स ने नोट किया कि MathVision बेंचमार्क पर मॉडल की सटीकता विचार प्रक्रिया की लंबाई के साथ बढ़ती है।
Alibaba Qwen ने QVQ-Max पेश किया है - विज़ुअल थिंकिंग मॉडल का पहला संस्करण, जो दिसंबर में जारी पूर्वावलोकन QVQ-72B-Preview से आगे निकल गया है। यह मॉडल छवियों और वीडियो की सामग्री को समझता है, उनके आधार पर विश्लेषण और तर्क करता है, गणित की समस्याओं से लेकर रोजमर्रा के सवालों और रचनात्मकता तक समस्याओं को हल करने में मदद करता है। MathVision बेंचमार्क, जो जटिल मल्टीमॉडल गणितीय कार्यों को एकत्र करता है, पर मॉडल की सटीकता अधिकतम विचार प्रक्रिया लंबाई बढ़ने पर बढ़ जाती है। QVQ-Max में तीन प्रमुख क्षमताएं हैं: विस्तृत अवलोकन (वस्तुओं, टेक्स्ट और छोटे विवरणों की पहचान), गहन तर्क (विज़ुअल जानकारी और पृष्ठभूमि ज्ञान के आधार पर निष्कर्ष निकालना), और लचीला अनुप्रयोग (समस्या समाधान से लेकर इलस्ट्रेशन और स्क्रिप्ट बनाने तक)। डेमो उदाहरणों में काम पर सहायता (डेटा विश्लेषण, कोड लिखना), शिक्षा (डायग्राम के साथ समस्याओं को हल करना) और दैनिक जीवन (कपड़ों और रेसिपी के सुझाव) शामिल हैं। भविष्य की योजनाओं में सत्यापन तंत्र के माध्यम से पहचान सटीकता में सुधार, बहु-चरणीय कार्यों (स्मार्टफोन या कंप्यूटर को नियंत्रित करना) के लिए विज़ुअल एजेंट का विकास, और उपकरणों और विज़ुअल जनरेशन को जोड़कर इंटरैक्शन में सुधार शामिल है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार