연구모델 🇺🇸 27.07.2026 18:04

SRPO: Kuaishou의 새로운 강화학습 방법, LLM 훈련에서 GRPO보다 10배 효율적

Kuaishou의 Kwaipilot 팀 연구자들은 SRPO라는 2단계 강화학습 프레임워크를 도입했습니다. 이 방법은 수학 및 코드 영역에서 DeepSeek-R1-Zero 수준의 성능을 훈련 단계의 10분의 1만으로 달성합니다. SRPO는 단계별 훈련 및 히스토리 재샘플링을 통해 교차 도메인 최적화 충돌, 낮은 샘플 효율성 및 조기 포화 문제를 해결합니다.
Kuaishou의 Kwaipilot 팀이 LLM을 위한 강화학습 프레임워크인 SRPO(Two-Staged history-Resampling Policy Optimization)를 개발했으며, 이는 표준 GRPO를 능가합니다. SRPO는 두 단계의 훈련 패러다임을 사용합니다. 첫 번째 단계에서는 추론을 이끌어내기 위해 도전적인 수학 데이터로 훈련하고, 두 번째 단계에서는 기술 조합을 위해 코드 데이터를 통합합니다. History Resampling은 보상 분산이 0인 쉬운 샘플을 필터링하여 효과적인 그래디언트 업데이트를 보장합니다. 실험 결과, SRPO-Qwen-32B는 AIME24에서 50점, LiveCodeBench에서 41.6점을 기록하여 DeepSeek-R1-Zero-32B와 비슷한 성능을 보이면서도 훈련 단계는 10배 더 적었습니다. 이 모델은 재확인, 망설임, 탐색과 같은 반성적 행동을 보이며, 수학 솔루션을 검증하기 위해 자발적으로 코드를 사용합니다. 팀은 모델을 오픈소스로 공개하고 기술 보고서를 발표했습니다.
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스