كيوين 2.5-ماكس: استكشاف قدرات نموذج خليط الخبراء واسع النطاق
Alibaba/Qwen
أصدرت مجموعة علي بابا كيوين نموذج كيوين 2.5-ماكس، وهو نموذج لغوي كبير يعتمد على بنية خليط الخبراء، تم تدريبه على أكثر من 20 تريليون رمز. يتفوق النموذج على ديب سيك V3 في عدة معايير، ويتوفر عبر واجهات برمجة تطبيقات سحابة علي بابا وتطبيق كيوين شات.
أعلن فريق Qwen عن إطلاق Qwen2.5-Max، وهو نموذج لغوي كبير يعتمد على بنية خبراء مختلطين (MoE)، تم تدريبه مسبقًا على أكثر من 20 تريليون رمز. بعد التدريب المسبق، تم تطبيق الضبط الدقيق الخاضع للإشراف (SFT) والتعلم التعزيزي من التغذية الراجعة البشرية (RLHF). تمت مقارنة النموذج مع DeepSeek V3 وGPT-4o وClaude-3.5-Sonnet على معايير MMLU-Pro وLiveCodeBench وLiveBench وArena-Hard وGPQA-Diamond. تفوق Qwen2.5-Max على DeepSeek V3 في Arena-Hard وLiveBench وLiveCodeBench وGPQA-Diamond، بينما أظهر نتائج تنافسية في MMLU-Pro. بالنسبة للنماذج الأساسية، تمت المقارنة مع DeepSeek V3 وLlama-3.1-405B وQwen2.5-72B - أظهر Qwen2.5-Max مزايا كبيرة في معظم الاختبارات. النموذج متاح في Qwen Chat وعبر واجهة برمجة التطبيقات (API) من Alibaba Cloud (اسم النموذج: qwen-max-2025-01-25). واجهة API متوافقة مع واجهة OpenAI API.
المصدر: Alibaba Qwen —
الأصلي
