RechercheModèles 🇨🇳 27.07.2026 17:05

GSPO : apprentissage par renforcement scalable pour les modèles de langage

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen a introduit l'algorithme Group Sequence Policy Optimization (GSPO) pour remédier à l'instabilité et à l'effondrement du modèle lors d'un long entraînement par RL. GSPO utilise une optimisation au niveau des séquences, offrant une efficacité et une robustesse supérieures à GRPO, en particulier pour les modèles MoE. L'algorithme sous-tend les modèles Qwen3.
Alibaba Qwen a annoncé l'algorithme Group Sequence Policy Optimization (GSPO), conçu pour passer à l'échelle l'apprentissage par renforcement (RL) des modèles de langage. Les développeurs ont noté que les algorithmes RL existants, en particulier GRPO, souffrent d'une grave instabilité lors d'un apprentissage prolongé et peuvent conduire à un effondrement irréversible du modèle. GSPO définit le ratio d'importance (importance ratio) sur la base de la vraisemblance de la séquence (sequence likelihood) et effectue un clipping et une optimisation au niveau des séquences, et non des tokens individuels. Des expériences avec un démarrage à froid sur la base de Qwen3-30B-A3B-Base ont montré que GSPO atteint une efficacité d'apprentissage significativement plus élevée que GRPO et assure une amélioration continue des performances lorsque les coûts de calcul augmentent. Un avantage important de GSPO est l'élimination totale de la nécessité de la stratégie Routing Replay, qui était requise pour l'apprentissage stable des modèles Mixture-of-Experts (MoE) avec GRPO. De plus, l'optimisation au niveau des séquences rend GSPO plus tolérant aux erreurs de précision, ce qui simplifie l'infrastructure et permet d'utiliser directement la vraisemblance des moteurs d'inférence sans recalcul. GSPO a été appliqué avec succès dans l'apprentissage RL à grande échelle des modèles Qwen3 (Instruct, Coder, Thinking), ce qui a permis d'améliorer considérablement leurs performances dans les benchmarks AIME'24, LiveCodeBench et CodeForces. Les auteurs soulignent que la proportion de tokens élagués dans GSPO est de deux ordres de grandeur supérieure à celle de GRPO, tandis que l'efficacité de l'apprentissage reste plus élevée, ce qui indique une plus grande fiabilité de l'approche au niveau des séquences.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches