настройки (rejection fine-tuning) и правилового онлайн-обучения с подкреплением (rule-based online reinforcement learning). Данный подход направлен на повышение масштабируемости во время инференса, решая проблему разреженности вознаграждения — основное препятствие для масштабирования обучения с подкреплением в больших языковых моделях (Large Language Models, LLMs). Серия моделей R1 от DeepSeek уже подтвердила эффективность чистого обучения с подкреплением; теперь компания намекает на следующее поколение модели R2, которая, как ожидается, будет построена на этих достижениях. Сдвиг в масштабировании больших языковых моделей от предварительного обучения к пост-обучению, особенно в фазе инференса, следует за такими моделями, как OpenAI o1, которая использует обширные внутренние цепочки рассуждений (chain-of-thought reasoning).