InvestigaciónModelos 🇺🇸 28.07.2026 00:03

DeepSeek insinúa el modelo R2 y presenta nuevo método de escalado de inferencia SPCT

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AI ha publicado un artículo sobre el escalado en tiempo de inferencia para modelos de recompensa generales, introduciendo SPCT (Self-Principled Critique Tuning, o Ajuste de Crítica Autoprincipiada). La empresa insinúa su próximo modelo R2. La investigación aborda la dispersión de recompensas y busca mejorar la escalabilidad de los modelos de recompensa durante la inferencia.
DeepSeek AI publicó un artículo titulado 'Inference-Time Scaling for Generalist Reward Modeling' en el que presenta un nuevo método llamado Self-Principled Critique Tuning (SPCT). SPCT mejora los modelos de recompensa generalistas (GRM, por sus siglas en inglés) generando principios y críticas de forma dinámica mediante el ajuste por rechazo y el aprendizaje por refuerzo en línea basado en reglas. El enfoque busca mejorar la escalabilidad durante la inferencia, abordando la escasez de recompensa, un obstáculo importante en la ampliación del aprendizaje por refuerzo para LLM. La serie R1 de DeepSeek ya validó el entrenamiento puro con refuerzo; la empresa ahora insinúa el modelo de próxima generación R2, que se espera que se base en estos avances. El cambio en la escalabilidad de los LLM del preentrenamiento al postentrenamiento, especialmente en la fase de inferencia, sigue a modelos como el o1 de OpenAI, que utiliza un razonamiento extenso de cadena de pensamiento interna.
Fuente: Synced — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas