SRPO: Phương pháp RL mới của Kuaishou hiệu quả gấp 10 lần GRPO cho huấn luyện LLM
Các nhà nghiên cứu từ nhóm Kwaipilot của Kuaishou đã giới thiệu SRPO, một khung học tăng cường hai giai đoạn đạt được hiệu suất ngang với DeepSeek-R1-Zero trong các lĩnh vực toán học và mã nguồn chỉ với một phần mười số bước huấn luyện. SRPO giải quyết các xung đột tối ưu hóa giữa các miền, hiệu quả mẫu thấp và bão hòa sớm thông qua huấn luyện theo giai đoạn và lấy mẫu lại lịch sử.
Nhóm Kwaipilot của Kuaishou đã phát triển SRPO (Two-Staged history-Resampling Policy Optimization), một framework học tăng cường dành cho các mô hình ngôn ngữ lớn (LLM) vượt trội hơn so với GRPO tiêu chuẩn. SRPO áp dụng quy trình huấn luyện hai giai đoạn: đầu tiên huấn luyện trên dữ liệu toán học thách thức để kích thích suy luận, sau đó tích hợp dữ liệu mã để kết hợp kỹ năng. History Resampling lọc bỏ các mẫu dễ có phương sai phần thưởng bằng không, đảm bảo cập nhật gradient hiệu quả. Kết quả thí nghiệm cho thấy SRPO-Qwen-32B đạt điểm 50 trên AIME24 và 41,6 trên LiveCodeBench, tương đương với DeepSeek-R1-Zero-32B nhưng với số bước huấn luyện ít hơn gấp 10 lần. Mô hình thể hiện các hành vi phản xạ như kiểm tra lại, do dự và khám phá, đồng thời tự động sử dụng mã để xác minh lời giải toán. Nhóm nghiên cứu đã mã nguồn mở mô hình và công bố một báo cáo kỹ thuật.
Nguồn: Synced —
bản gốc
