PesquisaModelos 🇺🇸 27.07.2026 18:04

SRPO: Novo Método de RL da Kuaishou 10x Mais Eficiente que GRPO para Treinamento de LLM

Pesquisadores da equipe Kwaipilot da Kuaishou apresentaram o SRPO, uma estrutura de aprendizado por reforço em dois estágios que alcança desempenho equivalente ao DeepSeek-R1-Zero nos domínios de matemática e código com apenas um décimo das etapas de treinamento. O SRPO aborda conflitos de otimização entre domínios, baixa eficiência amostral e saturação prematura por meio de treinamento em estágios e reamostragem de histórico.
A equipe Kwaipilot da Kuaishou desenvolveu o SRPO (Otimização de Política com Reamostragem de Histórico em Dois Estágios), um framework de aprendizado por reforço para LLMs que supera o GRPO padrão. O SRPO emprega um paradigma de treinamento em dois estágios: primeiro, treinamento em dados desafiadores de matemática para estimular o raciocínio e, em seguida, integração de dados de código para combinação de habilidades. A Reamostragem de Histórico filtra amostras fáceis com variância de recompensa zero, garantindo atualizações eficientes de gradiente. Experimentos mostram que o SRPO-Qwen-32B obtém pontuações de 50 no AIME24 e 41,6 no LiveCodeBench, comparável ao DeepSeek-R1-Zero-32B, mas com 10 vezes menos etapas de treinamento. O modelo exibe comportamentos reflexivos, como verificação, hesitação e exploração, e usa código espontaneamente para verificar soluções matemáticas. A equipe disponibilizou o modelo como código aberto e publicou um relatório técnico.
Fonte: Synced — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas