SRPO: Novo Método de RL da Kuaishou 10x Mais Eficiente Que GRPO para Treinamento de LLMs
Pesquisadores da Kuaishou apresentaram o SRPO, um método de aprendizado por reforço em duas etapas que alcança desempenho equivalente ao DeepSeek-R1-Zero em tarefas de matemática e código com 1/10 dos passos de treinamento. O método aborda conflitos entre domínios e problemas de uso ineficiente de amostras inerentes ao GRPO padrão.

