Learning with Verifiable Rewards, RLVR) на основе алгоритма групповой относительной оптимизации политики (Group Relative Policy Optimization, GRPO) — всё это адаптировано под среду выполнения с 16 ГБ памяти. Реализация опирается на репозиторий Open Instruct, из которого выборочно импортируются такие функции, как вычисление потерь DPO, потерь GRPO и логарифмических вероятностей. Настраиваются адаптеры низкоранговой адаптации (Low-Rank Adaptation, LoRA), а данные GSM8K подготавливаются для каждого этапа. Для оценки сгенерированных ответов на математические задачи используются детерминированные верификаторы (GSM8K, Math, IFEval). Распределённые компоненты — vLLM, акторы Ray и DeepSpeed — заменены на легковесные реализации на базе Hugging Face и PyTorch, пригодные для запуска в Colab. В качестве модели используется Qwen2.5-0.5B-Instruct.