Qwen2.5: फाउंडेशन मॉडल्स की एक पार्टी!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
Alibaba की Qwen टीम ने Qwen2.5 LLMs के ओपन-सोर्स रिलीज़ की घोषणा की, साथ ही कोडिंग (Qwen2.5-Coder) और गणित (Qwen2.5-Math) के लिए विशेष मॉडल भी। मॉडल 0.5B से 72B पैरामीटर तक हैं, जिन्हें 18 ट्रिलियन टोकन तक पर प्रीट्रेन किया गया है, जिसमें ज्ञान, कोडिंग और गणित क्षमताओं में महत्वपूर्ण सुधार हुआ है। रिलीज़ में API मॉडल Qwen-Plus और Qwen-Turbo भी शामिल हैं।
अलीबाबा के Qwen टीम ने Qwen2.5 जारी किया, जो ओपन-सोर्स डिकोडर-ओनली लैंग्वेज मॉडल का परिवार है, साथ ही विशेष मॉडल Qwen2.5-Coder और Qwen2.5-Math भी हैं। ये मॉडल 0.5B से 72B पैरामीटर तक के आकार में उपलब्ध हैं, जिन्हें 18 ट्रिलियन टोकन तक प्रीट्रेन किया गया है। Qwen2.5 MMLU 85+, HumanEval 85+ और MATH 80+ प्राप्त करता है, 128K टोकन तक कॉन्टेक्स्ट और 8K जनरेशन को सपोर्ट करता है, और 29 से अधिक भाषाओं के लिए बहुभाषी समर्थन प्रदान करता है। Qwen2.5-Coder को कोड डेटा के 5.5 ट्रिलियन टोकन पर प्रशिक्षित किया गया, जबकि Qwen2.5-Math CoT, PoT और TIR रीज़निंग को सपोर्ट करता है। फ्लैगशिप API मॉडल Qwen-Plus और Qwen-Turbo भी पेश किए गए हैं। 3B और 72B वेरिएंट Apache 2.0 लाइसेंस के अंतर्गत नहीं हैं।
स्रोत: Alibaba Qwen —
मूल
