AraştırmaModeller 🇺🇸 27.07.2026 20:04

Managing Reasoning Levels in Large Language Models

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka explains how reasoning modes of varying complexity (low, medium, high) work in large language models. He discusses reinforcement learning methods with verifiable rewards, as well as mechanisms for switching between modes, including approaches used in models like DeepSeek-R1, Qwen3, and GPT-5.6.
Makale yazarı, LLM'lerin iki yıl önce OpenAI o1 modelinin ortaya çıkışıyla başlayarak, ardından DeepSeek-R1'in RLVR (Reinforcement Learning with Verifiable Rewards, Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme) eğitim metodolojisiyle devam eden süreçte, farklı çaba seviyeleriyle nasıl akıl yürütmeyi öğrendiklerini açıklıyor. Yakın zamanda OpenAI, üç boyut ve yaklaşık beş-altı akıl yürütme çabası ayarı içeren GPT-5.6 ailesini yayınladı. Makale, akıl yürütme modellerinin kısa bir tanımını veriyor: bunlar, soruyu adım adım işleyerek ara bir akıl yürütme izi üretir. Performansı iyileştirmenin iki yolu tartışılıyor: eğitim ölçeklendirmesi (training scaling) ve çıkarım ölçeklendirmesi (inference scaling). Eğitimde, doğrulanabilir alanlarda (matematik, kod) cevapların doğruluğu için ödül verilen RLVR kullanılır. DeepSeek-R1, tam boru hattı çok aşamalı olmasına rağmen bu davranışın saf RL (Reinforcement Learning, Pekiştirmeli Öğrenme) ile elde edilebileceğini gösterdi. Ayrıca, akıl yürütme izinin sınırlarını işaretlemekten başka bir işlevi olmayan ve modele düşünme yeteneği vermeyen <think> ve </think> etiketleri ele alınıyor. Qwen3 örneğinde, tokenlaştırıcı (enable_thinking) aracılığıyla akıl yürütme modunun nasıl etkinleştirilip devre dışı bırakıldığı gösteriliyor. Son olarak, GPT-5.6'da akıl yürütme çabası ayarlarının nasıl uygulanabileceği tartışılıyor: muhtemelen yanıt uzunluğunu ve doğruluğunu etkileyen bir sistem yönergesi (system prompt) aracılığıyla.
Kaynak: Sebastian Raschka — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler