Gestión de niveles de razonamiento en modelos de lenguaje de gran escala
OpenAI
DeepSeek
Moonshot AI
El artículo explica cómo modelos de razonamiento como DeepSeek-R1 y GPT-5.6 aprenden a producir trazas de razonamiento mediante aprendizaje por refuerzo con recompensas verificables (RLVR). Detalla el proceso de entrenamiento, el escalado en inferencia, los tokens de pensamiento y cómo se implementan los modos de esfuerzo de razonamiento (bajo/medio/alto) a través de ajuste fino supervisado y cambios en el tokenizador.
Desde que OpenAI lanzó o1, los modelos de razonamiento que generan trazas intermedias de razonamiento se han convertido en el estándar. DeepSeek-R1 popularizó el entrenamiento RLVR, donde un modelo es recompensado por respuestas correctas en tareas de matemáticas y código, sin utilizar la traza de razonamiento para las actualizaciones. Esto llevó a momentos "Eureka" en los que los modelos aprenden a autocorregirse. Kimi K1.5 y Tülu 3 también contribuyeron a este enfoque, con R1-Zero demostrando que el RLVR puro puede enseñar razonamiento. El escalado de inferencia, como la autoconsistencia mediante votación por mayoría, mejora aún más el rendimiento. Los tokens de pensamiento (<think></think>) son marcadores cosméticos para separar el razonamiento de las respuestas, no esenciales para el razonamiento. La alternancia de modo de razonamiento (activado/desactivado) se implementa mediante ajuste fino supervisado con ejemplos con y sin pensamiento, reforzado durante el RL. Los ajustes de esfuerzo de razonamiento (bajo/medio/alto) en modelos como GPT-5.6 probablemente controlan la longitud y precisión de las respuestas, posiblemente mediante indicaciones del sistema, como se ve en los modelos gpt-oss de OpenAI.
Fuente: Sebastian Raschka —
original
