RechercheModèles 🇨🇳 27.07.2026 17:05

GSPO : Apprentissage par renforcement à grande échelle pour les modèles de langage

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen propose Group Sequence Policy Optimization (GSPO), un nouvel algorithme d'apprentissage par renforcement qui résout l'instabilité des méthodes existantes telles que GRPO. GSPO utilise une optimisation au niveau des séquences pour améliorer l'efficacité de l'entraînement, la stabilité et la compatibilité avec les modèles Mixture-of-Experts, contribuant ainsi aux performances des modèles Qwen3.
Alibaba Qwen présente GSPO (Group Sequence Policy Optimization), un algorithme d'apprentissage par renforcement conçu pour passer à l'échelle l'entraînement des modèles de langage. Contrairement aux algorithmes existants comme GRPO, GSPO définit le ratio d'importance en fonction de la vraisemblance des séquences et effectue un clipping, un reward et une optimisation au niveau de la séquence. Cette approche résout les graves problèmes d'instabilité observés avec GRPO lors d'un entraînement long, y compris l'effondrement irréversible du modèle. GSPO démontre une efficacité d'entraînement significativement supérieure, obtenant de meilleures performances pour un même coût d'entraînement, et permet des améliorations continues des performances avec l'augmentation de la puissance de calcul. Il stabilise également de manière inhérente l'entraînement des grands modèles Mixture-of-Experts (MoE), éliminant le besoin de la stratégie Routing Replay requise par GRPO. De plus, GSPO est plus tolérant aux écarts de précision, ce qui le rend adapté à l'infrastructure pour des scénarios tels que le déploiement partiel et l'apprentissage par renforcement multi-tours. GSPO a été appliqué avec succès à l'entraînement RL à grande échelle des derniers modèles Qwen3, libérant ainsi davantage le potentiel du passage à l'échelle RL.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches