SRPO: Uusi RL-menetelmä Kuaishoulta, 10 kertaa tehokkaampi kuin GRPO LLM-koulutuksessa
Kuaishoun tutkijat esittelivät SRPO:n, kaksivaiheisen vahvistusoppimismenetelmän, joka saavuttaa DeepSeek-R1-Zero-tason suorituskyvyn matematiikka- ja kooditehtävissä kymmenesosassa harjoitusvaiheista. Menetelmä ratkaisee standardin GRPO:n luontaisia ongelmia, kuten toimialueiden välisiä ristiriitoja ja tehottomia näytteiden hyödyntämistä.
Команда Kwaipilot из Kuaishou опубликовала новую архитектуру обучения с подкреплением — Two-Staged history-Resampling Policy Optimization (SRPO), которая решает ключевые проблемы стандартного GRPO: конфликты между математическими и код-задачами, низкую эффективность из-за одинаковых наград внутри группы и преждевременное насыщение. SRPO состоит из двух этапов: на первом модель обучается только на сложных математических данных для развития длинных цепочек рассуждений, на втором добавляются задачи по программированию для закрепления навыков. Для повышения эффективности используется History Resampling — пересборка датасета с исключением слишком простых примеров, где все варианты ответов верны. В результате модель SRPO-Qwen-32B на базе Qwen2.5-32B показала на бенчмарках AIME24 (50 баллов) и LiveCodeBench (41,6 балла) результаты, сопоставимые с DeepSeek-R1-Zero-32B, но при этом потребовала лишь 1/10 шагов обучения. В ходе экспериментов модель научилась спонтанно использовать программный код для проверки математических решений.
Lähde: Synced —
Alkuperäinen
