Управление уровнем рассуждений в больших языковых моделях
OpenAI
DeepSeek
Moonshot AI
Себастьян Рашка объясняет, как работают режимы рассуждений разной степени сложности (низкий, средний, высокий) в больших языковых моделях. Рассматриваются методы обучения через подкрепление с проверяемыми наградами, а также механизмы переключения между режимами, включая подходы, использованные в моделях DeepSeek-R1, Qwen3 и GPT-5.6.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный
Показать ещё ↓
- Сокращения
- RLVR = Reinforcement Learning with Verifiable Rewards — обучение с подкреплением с проверяемыми наградами
- RL = Reinforcement Learning — обучение с подкреплением
- SFT = Supervised Fine-Tuning — контролируемая донастройка
Источник: Sebastian Raschka —
оригинал
