Kuaishou

Последние новости ИИ, модели и релизы от Kuaishou.

SRPO: новый метод RL от Kuaishou в 10 раз эффективнее GRPO для обучения LLM

Исследователи из Kuaishou представили SRPO — двухэтапный метод обучения с подкреплением, который позволяет достичь уровня DeepSeek-R1-Zero на задачах математики и кода за 1/10 шагов обучения. Метод решает проблемы кросс-доменных конфликтов и неэффективного использования выборок, присущие стандартному GRPO.

Synced27.07 · 18:04
Свежие новости