сначала обучение на сложных математических данных для развития рассуждений, затем интеграция данных по программированию для комбинирования навыков. History Resampling отсеивает простые примеры с нулевой дисперсией вознаграждения, обеспечивая эффективное обновление градиентов. Эксперименты показывают, что SRPO-Qwen-32B достигает результатов 50 баллов на AIME24 и 41,6 балла на LiveCodeBench, что сопоставимо с DeepSeek-R1-Zero-32B, но при этом требует в 10 раз меньше шагов обучения. Модель демонстрирует рефлексивное поведение, такое как перепроверка, колебания и исследование, а также спонтанно использует код для проверки математических решений. Команда опубликовала модель в открытом доступе и выпустила технический отчет.