QwQ-32B: تسخير قوة التعلم المعزز
Alibaba/Qwen
DeepSeek
OpenAI
أطلقت Alibaba Qwen نموذج QwQ-32B بـ 32 مليار معلمة، والذي يحقق أداءً مشابهاً لنموذج DeepSeek-R1 (671 مليار معلمة) من خلال التعلم المعزز القابل للتوسع. النموذج مفتوح المصدر بموجب ترخيص Apache 2.0 ويجمع بين التفكير وقدرات الوكيل.
أطلقت علي بابا نموذج QwQ-32B من سلسلة Qwen، الذي يضم 32 مليار معلمة، مستفيدًا من التعلم المعزز القابل للتوسع. يحقق النموذج أداءً مشابهًا لنموذج DeepSeek-R1 الذي يضم 671 مليار معلمة (منها 37 مليار معلمة نشطة). يعتمد التطوير على بداية باردة ومرحلتين من التعلم المعزز: الأولى على المهام الرياضية والبرمجية باستخدام مدقق صحة وخادم تنفيذ كود للتحقق من الحلول؛ والثانية على القدرات العامة باستخدام نموذج مكافأة عام وقواعد. يدمج QwQ-32B قدرات الوكلاء، مما يمكّن النموذج من التفكير النقدي واستخدام الأدوات والتكيف مع ردود الفعل من البيئة. النموذج متاح بأوزان مفتوحة على Hugging Face وModelScope تحت رخصة Apache 2.0، وكذلك عبر Qwen Chat وواجهة برمجة تطبيقات DashScope. في المستقبل، تخطط Qwen لدمج نماذج أساسية أقوى مع حوسبة التعلم المعزز القابلة للتوسع للاقتراب من الذكاء العام الاصطناعي ودمج الوكلاء مع التعلم المعزز للتفكير طويل المدى.
المصدر: Alibaba Qwen —
الأصلي
