Managing Reasoning Levels in Large Language Models
OpenAI
DeepSeek
Moonshot AI
Sebastian Raschka explains how reasoning modes of varying complexity (low, medium, high) work in large language models. He discusses reinforcement learning methods with verifiable rewards, as well as mechanisms for switching between modes, including approaches used in models like DeepSeek-R1, Qwen3, and GPT-5.6.
Penulis artikel ini menjelaskan bagaimana large language model (LLM) dilatih untuk bernalar dengan tingkat upaya yang berbeda-beda, dimulai dari kemunculan model OpenAI o1 dua tahun lalu, yang kemudian diikuti oleh DeepSeek-R1 dengan metodologi pelatihan RLVR (reinforcement learning from verifiable rewards). Baru-baru ini, OpenAI merilis keluarga GPT-5.6, yang mencakup tiga ukuran dan sekitar lima hingga enam pengaturan tingkat upaya penalaran.
Artikel ini memberikan definisi singkat tentang model penalaran (reasoning models): model-model ini menghasilkan jejak penalaran perantara, mengerjakan pertanyaan secara bertahap langkah demi langkah. Dibahas pula dua cara untuk meningkatkan performa: penskalaan pelatihan (training scaling) dan penskalaan inferensi (inference scaling). Dalam pelatihan, digunakan RLVR, di mana penghargaan (reward) diberikan atas ketepatan jawaban pada domain yang dapat diverifikasi (matematika, kode). DeepSeek-R1 menunjukkan bahwa perilaku semacam itu dapat dicapai melalui reinforcement learning (RL) murni, meskipun alur kerja lengkapnya sebenarnya bertahap dan terdiri dari banyak tahap.
Artikel ini juga membahas tag <think> dan </think>, yang hanya menandai batas-batas jejak penalaran dan tidak dengan sendirinya memberi model kemampuan untuk berpikir. Dengan menggunakan contoh Qwen3, ditunjukkan bagaimana pengaktifan/penonaktifan mode penalaran diimplementasikan melalui tokenizer (enable_thinking).
Terakhir, dibahas bagaimana pengaturan tingkat upaya penalaran mungkin diimplementasikan pada GPT-5.6: kemungkinan besar melalui system prompt yang memengaruhi panjang jawaban dan tingkat akurasi.
Sumber: Sebastian Raschka —
asli
