PesquisaModelos 🇨🇳 27.07.2026 17:05

GSPO: Aprendizado por Reforço Escalável para Modelos de Linguagem

Alibaba/QwenAlibaba/Qwen
A Alibaba Qwen propõe o Group Sequence Policy Optimization (GSPO), um novo algoritmo de aprendizado por reforço que aborda a instabilidade em métodos existentes como o GRPO. O GSPO utiliza otimização em nível de sequência para melhorar a eficiência do treinamento, a estabilidade e a compatibilidade com modelos Mixture-of-Experts, contribuindo para o desempenho dos modelos Qwen3.
A Alibaba Qwen apresenta a Group Sequence Policy Optimization (GSPO), um algoritmo de aprendizado por reforço projetado para escalar o treinamento de modelos de linguagem. Diferentemente de algoritmos existentes como GRPO, o GSPO define a razão de importância com base na verossimilhança da sequência e realiza clipping, recompensa e otimização no nível da sequência. Essa abordagem resolve problemas graves de instabilidade observados no GRPO durante treinamentos longos, incluindo colapso irreversível do modelo. O GSPO demonstra eficiência de treinamento significativamente maior, alcançando melhor desempenho sob o mesmo custo computacional e permitindo melhorias contínuas de desempenho com maior poder de processamento. Ele também estabiliza inerentemente o treinamento de grandes modelos Mixture-of-Experts (MoE), eliminando a necessidade da estratégia de Routing Replay exigida pelo GRPO. Além disso, o GSPO é mais tolerante a discrepâncias de precisão, tornando-se amigável à infraestrutura em cenários como rollout parcial e Reinforcement Learning (RL) de múltiplas rodadas. O GSPO foi aplicado com sucesso ao treinamento em larga escala por RL dos mais recentes modelos Qwen3, liberando ainda mais o potencial de escalabilidade do RL.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas