Verwaltung von Reasoning-Stufen in großen Sprachmodellen
OpenAI
DeepSeek
Moonshot AI
Sebastian Raschka erklärt, wie Reasoning-Modi unterschiedlicher Komplexität (niedrig, mittel, hoch) in großen Sprachmodellen funktionieren. Er diskutiert Methoden des bestärkenden Lernens mit überprüfbaren Belohnungen sowie Mechanismen zum Wechsel zwischen den Modi, einschließlich Ansätze, die in Modellen wie DeepSeek-R1, Qwen3 und GPT-5.6 verwendet werden.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный след рассуждений, пошагово прорабатывая вопрос. Обсуждается два способа улучшения производительности: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling). При обучении используется RLVR, где награда даётся за правильность ответов в верифицируемых областях (математика, код). DeepSeek-R1 показала, что такое поведение достигается чистым RL, хотя полный пайплайн многостадийный. Также рассмотрены теги <think> и </think>, которые лишь маркируют границы трассы рассуждений и не дают модели способности думать. На примере Qwen3 показано, как реализовано включение/отключение режима рассуждений через токенизатор (enable_thinking). Наконец, обсуждается, как могут быть реализованы настройки усилия рассуждений в GPT-5.6: вероятно, через системный промпт, влияющий на длину ответа и точность.
Quelle: Sebastian Raschka —
Original
