ИсследованияМодели 🇺🇸 27.07.2026 20:04

Управление уровнем рассуждений в больших языковых моделях

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Себастьян Рашка объясняет, как работают режимы рассуждений разной степени сложности (низкий, средний, высокий) в больших языковых моделях. Рассматриваются методы обучения через подкрепление с проверяемыми наградами, а также механизмы переключения между режимами, включая подходы, использованные в моделях DeepSeek-R1, Qwen3 и GPT-5.6.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный
Показать ещё ↓
Сокращения
RLVR = Reinforcement Learning with Verifiable Rewards — обучение с подкреплением с проверяемыми наградами
RL = Reinforcement Learning — обучение с подкреплением
SFT = Supervised Fine-Tuning — контролируемая донастройка
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости