PesquisaModelos 🇺🇸 28.07.2026 00:03

DeepSeek sugere modelo R2 e apresenta novo método de escalabilidade de inferência SPCT

DeepSeekDeepSeek OpenAIOpenAI
A DeepSeek publicou um estudo propondo o método Self-Principled Critique Tuning (SPCT) para melhorar a escalabilidade de modelos de recompensa gerais durante a inferência. Ao mesmo tempo, a empresa sugeriu o lançamento iminente de seu próximo modelo, R2, que deve ser baseado em abordagens de aprendizado por reforço puro.
O aprendizado profundo por reforço está se tornando um fator-chave para melhorar grandes modelos de linguagem após a fase de pré-treinamento, especialmente na etapa de inferência. DeepSeek e pesquisadores da Universidade Tsinghua propuseram o método Self-Principled Critique Tuning (SPCT), que inclui duas etapas: o rejection fine-tuning para inicialização a frio, permitindo que o modelo gere princípios e críticas no formato correto; e o rule-based online RL para otimização adicional. Para escalonamento eficiente, utiliza-se amostragem paralela, e um meta-reward model ajuda a selecionar a melhor recompensa. Experimentos mostraram que o SPCT melhora significativamente a qualidade e a escalabilidade de modelos de recompensa gerais, superando métodos existentes. Simultaneamente, a empresa deu indícios sobre o desenvolvimento da próxima geração do modelo R2, que provavelmente usará essas inovações. O artigo também observa que o paradigma de escalonamento de grandes modelos de linguagem está se deslocando do pré-treinamento para o pós-treinamento e a etapa de inferência, como demonstrado pelo modelo o1 da OpenAI, que gera uma longa cadeia interna de raciocínio antes de responder.
Fonte: Synced — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas