Gestion des niveaux de raisonnement dans les grands modèles de langage
OpenAI
DeepSeek
Moonshot AI
Sebastian Raschka explique comment les modes de raisonnement de complexité variable (faible, moyenne, élevée) fonctionnent dans les grands modèles de langage. Il aborde les méthodes d'apprentissage par renforcement avec récompenses vérifiables, ainsi que les mécanismes de basculement entre les modes, y compris les approches utilisées dans des modèles comme DeepSeek-R1, Qwen3 et GPT-5.6.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный след рассуждений, пошагово прорабатывая вопрос. Обсуждается два способа улучшения производительности: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling). При обучении используется RLVR, где награда даётся за правильность ответов в верифицируемых областях (математика, код). DeepSeek-R1 показала, что такое поведение достигается чистым RL, хотя полный пайплайн многостадийный. Также рассмотрены теги <think> и </think>, которые лишь маркируют границы трассы рассуждений и не дают модели способности думать. На примере Qwen3 показано, как реализовано включение/отключение режима рассуждений через токенизатор (enable_thinking). Наконец, обсуждается, как могут быть реализованы настройки усилия рассуждений в GPT-5.6: вероятно, через системный промпт, влияющий на длину ответа и точность.
Source: Sebastian Raschka —
original
