研究模型 🇺🇸 27.07.2026 20:04

管理大型语言模型中的推理级别

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka 解释了大型语言模型中不同复杂度推理模式(低、中、高)的工作原理。他讨论了具有可验证奖励的强化学习方法,以及在各种模式间切换的机制,包括 DeepSeek-R1、Qwen3 和 GPT-5.6 等模型中采用的方法。
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный след рассуждений, пошагово прорабатывая вопрос. Обсуждается два способа улучшения производительности: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling). При обучении используется RLVR, где награда даётся за правильность ответов в верифицируемых областях (математика, код). DeepSeek-R1 показала, что такое поведение достигается чистым RL, хотя полный пайплайн многостадийный. Также рассмотрены теги <think> и </think>, которые лишь маркируют границы трассы рассуждений и не дают модели способности думать. На примере Qwen3 показано, как реализовано включение/отключение режима рассуждений через токенизатор (enable_thinking). Наконец, обсуждается, как могут быть реализованы настройки усилия рассуждений в GPT-5.6: вероятно, через системный промпт, влияющий на длину ответа и точность.
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻