إدارة مستويات التفكير في نماذج اللغة الكبيرة
OpenAI
DeepSeek
Moonshot AI
يشرح سيباستيان راشكا كيفية عمل أوضاع التفكير ذات التعقيد المتفاوت (منخفض، متوسط، عالٍ) في نماذج اللغة الكبيرة. ويناقش أساليب التعلم التعزيزي مع المكافآت القابلة للتحقق، بالإضافة إلى آليات التبديل بين الأوضاع، بما في ذلك الأساليب المستخدمة في نماذج مثل DeepSeek-R1 وQwen3 وGPT-5.6.
Автор статьи объясняет, как LLM обучаются рассуждать с разным уровнем усилий, начиная с появления модели OpenAI o1 два года назад, за которой последовала DeepSeek-R1 с методикой обучения RLVR. Недавно OpenAI выпустила семейство GPT-5.6, которое включает три размера и примерно пять-шесть настроек усилия рассуждений. В статье даётся краткое определение моделей рассуждений: они выводят промежуточный след рассуждений, пошагово прорабатывая вопрос. Обсуждается два способа улучшения производительности: масштабирование обучения (training scaling) и масштабирование инференса (inference scaling). При обучении используется RLVR, где награда даётся за правильность ответов в верифицируемых областях (математика, код). DeepSeek-R1 показала, что такое поведение достигается чистым RL, хотя полный пайплайн многостадийный. Также рассмотрены теги <think> и </think>, которые лишь маркируют границы трассы рассуждений и не дают модели способности думать. На примере Qwen3 показано, как реализовано включение/отключение режима рассуждений через токенизатор (enable_thinking). Наконец, обсуждается, как могут быть реализованы настройки усилия рассуждений в GPT-5.6: вероятно, через системный промпт, влияющий на длину ответа и точность.
المصدر: Sebastian Raschka —
الأصلي
