Qwen2.5-Max: एक बड़े पैमाने के MoE मॉडल की क्षमताओं की खोज

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ने Qwen2.5-Max जारी किया, जो Mixture-of-Experts आर्किटेक्चर पर आधारित एक बड़ा भाषा मॉडल है, जिसे 20 ट्रिलियन से अधिक टोकन पर प्रशिक्षित किया गया है। यह मॉडल कई बेंचमार्क पर DeepSeek V3 से बेहतर प्रदर्शन करता है और Alibaba Cloud APIs और Qwen Chat के माध्यम से उपलब्ध है।
क्वेन टीम ने क्वेन2.5-मैक्स जारी किया है, जो मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर पर आधारित एक बड़ा भाषा मॉडल है, जिसे 20 ट्रिलियन से अधिक टोकन पर प्री-ट्रेन किया गया है। प्री-ट्रेनिंग के बाद, सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) और रीइन्फोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक (RLHF) लागू किए गए। मॉडल की तुलना डीपसीक V3, GPT-4o और क्लॉड-3.5-सॉनेट से एमएमएलयू-प्रो, लाइवकोडबेंच, लाइवबेंच, एरीना-हार्ड और जीपीक्यूए-डायमंड बेंचमार्क पर की गई। क्वेन2.5-मैक्स ने एरीना-हार्ड, लाइवबेंच, लाइवकोडबेंच और जीपीक्यूए-डायमंड में डीपसीक V3 को पीछे छोड़ दिया, जबकि एमएमएलयू-प्रो में प्रतिस्पर्धी परिणाम दिखाए। बेस मॉडल के लिए, डीपसीक V3, लामा-3.1-405B और क्वेन2.5-72B से तुलना की गई — क्वेन2.5-मैक्स ने अधिकांश परीक्षणों में महत्वपूर्ण लाभ प्रदर्शित किया। मॉडल क्वेन चैट और अलीबाबा क्लाउड एपीआई (मॉडल नाम: qwen-max-2025-01-25) के माध्यम से उपलब्ध है। एपीआई ओपनएआई एपीआई के साथ संगत है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार