Управление уровнями рассуждений в больших языковых моделях
OpenAI
DeepSeek
Moonshot AI
В статье объясняется, как модели рассуждений, такие как DeepSeek-R1 и GPT-5.6, учатся генерировать цепочки рассуждений с помощью обучения с подкреплением на основе проверяемых вознаграждений (RLVR). Подробно описываются процесс обучения, масштабирование вывода, токены размышлений, а также то, как режимы усилия рассуждения (низкий/средний/высокий) реализуются с помощью контролируемой точной настройки и переключения токенизатора.
С момента выхода o1 от OpenAI модели рассуждений, генерирующие промежуточные цепочки размышлений, стали стандартом. DeepSeek-R1 популяризировала обучение по методу RLVR (reinforcement learning with verifiable rewards — обучение с подкреплением на основе проверяемых наград), при котором модель получает награду за правильные ответы в задачах по математике и программированию, при этом сама цепочка
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
