QwQ-32B: Takviyeli Öğrenmenin Gücünden Yararlanmak
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen, 32 milyar parametreye sahip QwQ-32B modelini tanıttı. Bu model, ölçeklenebilir takviyeli öğrenme (reinforcement learning, RL) sayesinde DeepSeek-R1 (671 milyar parametre) ile karşılaştırılabilir performans elde ediyor. Model, Apache 2.0 lisansı altında açık kaynak olarak sunuluyor ve akıl yürütmeyi ajan yetenekleriyle birleştiriyor.
Alibaba'nın Qwen ekibi, ölçeklenebilir pekiştirmeli öğrenme (RL) kullanan 32 milyar parametreli QwQ-32B modelini tanıttı. Model, 671 milyar parametreye (bunun 37 milyarı aktif) sahip DeepSeek-R1 ile karşılaştırılabilir performans gösteriyor. Geliştirme, soğuk başlangıç ve iki aşamalı RL'ye dayanıyor: önce, bir doğruluk doğrulayıcı ve çözümleri doğrulamak için kod yürütme sunucusu kullanarak matematiksel ve programlama görevlerinde; ardından genel bir ödül modeli ve kurallar kullanarak genel yetenekler üzerinde. QwQ-32B, ajan yeteneklerini entegre ederek modelin eleştirel düşünmesini, araçları kullanmasını ve çevreden gelen geri bildirimlere uyum sağlamasını mümkün kılıyor. Model, Apache 2.0 lisansı altında Hugging Face ve ModelScope'da açık ağırlıklar olarak ve ayrıca Qwen Chat ile DashScope API üzerinden kullanıma sunuldu. Gelecekte Qwen, yapay genel zekaya (AGI) yaklaşmak için daha güçlü temel modelleri ölçeklenebilir RL hesaplamasıyla birleştirmeyi ve uzun vadeli akıl yürütme için ajanları RL ile entegre etmeyi planlıyor.
Kaynak: Alibaba Qwen —
orijinal
