PesquisaModelos 🇺🇸 27.07.2026 20:04

Gerenciando Níveis de Raciocínio em Grandes Modelos de Linguagem

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka explica como modos de raciocínio de complexidade variada (baixo, médio, alto) funcionam em grandes modelos de linguagem. Ele discute métodos de aprendizado por reforço com recompensas verificáveis, bem como mecanismos para alternar entre modos, incluindo abordagens usadas em modelos como DeepSeek-R1, Qwen3 e GPT-5.6.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный след рассуждений, пошагово прорабатывая вопрос. Обсуждается два способа улучшения производительности: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling). При обучении используется RLVR, где награда даётся за правильность ответов в верифицируемых областях (математика, код). DeepSeek-R1 показала, что такое поведение достигается чистым RL, хотя полный пайплайн многостадийный. Также рассмотрены теги <think> и </think>, которые лишь маркируют границы трассы рассуждений и не дают модели способности думать. На примере Qwen3 показано, как реализовано включение/отключение режима рассуждений через токенизатор (enable_thinking). Наконец, обсуждается, как могут быть реализованы настройки усилия рассуждений в GPT-5.6: вероятно, через системный промпт, влияющий на длину ответа и точность.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas