मॉडलशोध 🇨🇳 28.07.2026 01:05

QwQ-32B: सुदृढीकरण सीखने की शक्ति का दोहन

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwen ने 32 बिलियन पैरामीटर वाले QwQ-32B मॉडल का अनावरण किया, जो स्केलेबल सुदृढीकरण सीखने (RL) के माध्यम से DeepSeek-R1 (671 बिलियन पैरामीटर) के बराबर प्रदर्शन प्राप्त करता है। यह मॉडल Apache 2.0 लाइसेंस के तहत ओपन-सोर्स है और तर्क क्षमता को एजेंट क्षमताओं के साथ जोड़ता है।
अलीबाबा के क्यूवेन ने 32 बिलियन पैरामीटर वाला QwQ-32B मॉडल पेश किया है, जो स्केलेबल रीइन्फोर्समेंट लर्निंग (आरएल) का लाभ उठाता है। यह मॉडल 671 बिलियन पैरामीटर (जिनमें से 37 बिलियन सक्रिय होते हैं) वाले DeepSeek-R1 के बराबर प्रदर्शन हासिल करता है। इसका विकास कोल्ड स्टार्ट और दो-चरणीय आरएल पर आधारित है: पहले, गणितीय और प्रोग्रामिंग कार्यों पर एक शुद्धता सत्यापनकर्ता और कोड निष्पादन सर्वर का उपयोग करके समाधानों को मान्य किया जाता है; फिर, एक सामान्य पुरस्कार मॉडल और नियमों का उपयोग करके सामान्य क्षमताओं पर काम किया जाता है। QwQ-32B एजेंट क्षमताओं को एकीकृत करता है, जिससे मॉडल आलोचनात्मक सोच, उपकरणों का उपयोग और पर्यावरण से फीडबैक के अनुकूल होने में सक्षम होता है। यह मॉडल हगिंग फेस और मॉडलस्कोप पर Apache 2.0 लाइसेंस के तहत ओपन वेट के रूप में, साथ ही Qwen Chat और DashScope API के माध्यम से उपलब्ध है। भविष्य में, क्यूवेन आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई) तक पहुँचने के लिए मजबूत बेस मॉडल को स्केलेबल आरएल कंप्यूटेशन के साथ संयोजित करने और दीर्घकालिक तर्क के लिए एजेंटों को आरएल के साथ एकीकृत करने की योजना बना रहा है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार