QwQ-32B : exploiter la puissance de l'apprentissage par renforcement
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen a dévoilé le modèle QwQ-32B avec 32 milliards de paramètres, qui atteint des performances comparables à DeepSeek-R1 (671 milliards de paramètres) grâce à un apprentissage par renforcement (RL) scalable. Le modèle est open source sous licence Apache 2.0 et combine raisonnement et capacités d'agent.
Alibaba's Qwen a présenté le modèle QwQ-32B avec 32 milliards de paramètres, exploitant l'apprentissage par renforcement (RL) à grande échelle. Le modèle atteint des performances comparables à DeepSeek-R1, qui compte 671 milliards de paramètres (dont 37 milliards actifs). Le développement repose sur un démarrage à froid et un RL en deux étapes : d'abord, sur des tâches mathématiques et de programmation, en utilisant un vérificateur de correction et un serveur d'exécution de code pour valider les solutions ; ensuite, sur des capacités générales, en utilisant un modèle de récompense général et des règles. QwQ-32B intègre des capacités d'agent, permettant au modèle de penser de manière critique, d'utiliser des outils et de s'adapter aux retours de l'environnement. Le modèle est disponible sous forme de poids ouverts sur Hugging Face et ModelScope sous licence Apache 2.0, ainsi que via Qwen Chat et l'API DashScope. À l'avenir, Qwen prévoit de combiner des modèles de base plus puissants avec un calcul RL extensible pour se rapprocher de l'intelligence artificielle générale (AGI) et d'intégrer des agents avec le RL pour un raisonnement à long terme.
Source: Alibaba Qwen —
original
