PesquisaModelos 🇺🇸 28.07.2026 00:03

DeepSeek sugere modelo R2 e apresenta novo método de escalonamento de inferência SPCT

DeepSeekDeepSeek OpenAIOpenAI
A DeepSeek AI publicou um artigo sobre escalonamento em tempo de inferência para modelos de recompensa gerais, introduzindo o SPCT (Self-Principled Critique Tuning). A empresa sugere seu próximo modelo R2. A pesquisa aborda a escassez de recompensa e visa melhorar a escalabilidade dos modelos de recompensa durante a inferência.
A DeepSeek AI publicou um artigo intitulado 'Inference-Time Scaling for Generalist Reward Modeling' (Escalabilidade em Tempo de Inferência para Modelagem de Recompensa Generalista), introduzindo um novo método chamado Self-Principled Critique Tuning (SPCT) (Ajuste de Crítica Autoprincipada). O SPCT aprimora os modelos de recompensa generalistas (General Reward Models, GRMs) gerando dinamicamente princípios e críticas por meio de ajuste por rejeição e aprendizado por reforço online baseado em regras. A abordagem visa melhorar a escalabilidade durante a inferência, abordando a escassez de recompensa — um grande obstáculo na escalabilidade do aprendizado por reforço para Large Language Models (LLMs) (Modelos de Linguagem de Grande Escala). A série R1 da DeepSeek já validou o treinamento puro com aprendizado por reforço; a empresa agora sugere o modelo de próxima geração R2, que deve se basear nesses avanços. A mudança na escalabilidade de LLMs do pré-treinamento para o pós-treinamento, especialmente na fase de inferência, segue modelos como o o1 da OpenAI, que utiliza raciocínio extenso de cadeia de pensamento interna.
Fonte: Synced — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas