QwQ-32B: De kracht van reinforcement learning benutten
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen onthulde het QwQ-32B-model met 32 miljard parameters, dat prestaties levert die vergelijkbaar zijn met DeepSeek-R1 (671B parameters) door middel van schaalbare reinforcement learning (RL). Het model is open source onder de Apache 2.0-licentie en combineert redeneren met agentmogelijkheden.
Alibaba heeft met Qwen het QwQ-32B-model geïntroduceerd, dat 32 miljard parameters telt en gebruikmaakt van schaalbare reinforcement learning (RL). Het model presteert vergelijkbaar met DeepSeek-R1, dat 671 miljard parameters heeft (waarvan 37 miljard actief zijn). De ontwikkeling is gebaseerd op een koude start en een tweetraps RL: eerst op wiskundige en programmeertaken met behulp van een correctheidsverificator en een code-uitvoeringsserver om oplossingen te valideren; vervolgens op algemene vaardigheden met behulp van een algemeen beloningsmodel en regels. QwQ-32B integreert agent-capaciteiten, waardoor het model kritisch kan denken, hulpmiddelen kan gebruiken en kan inspelen op feedback uit de omgeving. Het model is beschikbaar als open gewichten op Hugging Face en ModelScope onder de Apache 2.0-licentie, evenals via Qwen Chat en de DashScope API. In de toekomst is Qwen van plan om sterkere basismodellen te combineren met schaalbare RL-berekening om kunstmatige algemene intelligentie (AGI) te benaderen en agenten te integreren met RL voor langetermijnredeneringen.
Bron: Alibaba Qwen —
origineel
