ForschungModelle 🇨🇳 27.07.2026 17:05

GSPO: skalierbares Reinforcement Learning für Sprachmodelle

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen hat den Group Sequence Policy Optimization (GSPO)-Algorithmus vorgestellt, um Instabilität und Modellkollaps während langem RL-Training zu adressieren. GSPO nutzt Optimierung auf Sequenzebene und bietet höhere Effizienz und Robustheit als GRPO, insbesondere für MoE-Modelle. Der Algorithmus liegt den Qwen3-Modellen zugrunde.
Alibaba Qwen hat den Algorithmus Group Sequence Policy Optimization (GSPO) vorgestellt, der für das Skalieren von Reinforcement Learning (RL) von Sprachmodellen entwickelt wurde. Die Entwickler stellten fest, dass bestehende RL-Algorithmen, insbesondere Group Relative Policy Optimization, unter erheblicher Instabilität bei langem Training leiden und zu einem irreversiblen Kollaps des Modells führen können. GSPO definiert ein Importance Ratio basierend auf der Sequenzwahrscheinlichkeit (Sequence Likelihood) und führt Clipping sowie Optimierung auf Sequenzebene durch, anstatt auf einzelne Token. Experimente mit einem Kaltstart auf Basis von Qwen3-30B-A3B-Base zeigten, dass GSPO eine deutlich höhere Trainingseffizienz als Group Relative Policy Optimization erreicht und bei steigenden Rechenkosten eine kontinuierliche Leistungsverbesserung gewährleistet. Ein wichtiger Vorteil von GSPO ist der vollständige Wegfall der Notwendigkeit einer Routing-Replay-Strategie, die für stabiles Training von Mixture-of-Experts-Modellen mit Group Relative Policy Optimization erforderlich war. Darüber hinaus macht die Optimierung auf Sequenzebene GSPO toleranter gegenüber Genauigkeitsfehlern, was die Infrastruktur vereinfacht und die direkte Nutzung der Wahrscheinlichkeiten von Inference-Engines ohne Neuberechnung ermöglicht. GSPO wurde erfolgreich im groß angelegten RL-Training der Qwen3-Modelle eingesetzt, wodurch deren Leistung in den Benchmarks AIME'24, LiveCodeBench und CodeForces deutlich verbessert werden konnte. Die Autoren betonen, dass der Anteil der abgeschnittenen Token (clipped tokens) bei GSPO um zwei Größenordnungen höher ist als bei Group Relative Policy Optimization, während die Trainingseffizienz dennoch höher bleibt, was auf eine größere Robustheit des sequenzbasierten Ansatzes hinweist.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten