Managing Reasoning Levels in Large Language Models
OpenAI
DeepSeek
Moonshot AI
Sebastian Raschka explains how reasoning modes of varying complexity (low, medium, high) work in large language models. He discusses reinforcement learning methods with verifiable rewards, as well as mechanisms for switching between modes, including approaches used in models like DeepSeek-R1, Qwen3, and GPT-5.6.
Tác giả bài viết giải thích cách các LLM được huấn luyện để suy luận với các mức nỗ lực khác nhau, bắt đầu từ sự xuất hiện của mô hình OpenAI o1 hai năm trước, sau đó là DeepSeek-R1 với phương pháp huấn luyện RLVR (học tăng cường với phần thưởng xác minh). Gần đây, OpenAI đã phát hành dòng GPT-5.6, bao gồm ba kích cỡ và khoảng năm đến sáu mức cài đặt nỗ lực suy luận. Bài viết đưa ra định nghĩa ngắn gọn về các mô hình suy luận: chúng tạo ra một dấu vết suy luận trung gian, xử lý câu hỏi từng bước một. Hai phương pháp cải thiện hiệu suất được thảo luận là mở rộng quy mô huấn luyện (training scaling) và mở rộng quy mô suy luận (inference scaling). Khi huấn luyện, RLVR được sử dụng, trong đó phần thưởng được trao cho tính chính xác của câu trả lời trong các lĩnh vực có thể xác minh (toán học, mã nguồn). DeepSeek-R1 cho thấy hành vi này có thể đạt được thông qua RL thuần túy, mặc dù quy trình đầy đủ có nhiều giai đoạn. Các thẻ <think> và </think> cũng được xem xét, chúng chỉ đánh dấu ranh giới của dấu vết suy luận chứ không cung cấp cho mô hình khả năng suy nghĩ. Trên ví dụ về Qwen3, cách bật/tắt chế độ suy luận thông qua bộ token hóa (enable_thinking) được trình bày. Cuối cùng, bài viết thảo luận về cách các mức cài đặt nỗ lực suy luận trong GPT-5.6 có thể được triển khai: có thể thông qua prompt hệ thống, ảnh hưởng đến độ dài phản hồi và độ chính xác.
Nguồn: Sebastian Raschka —
bản gốc
