DeepSeek laisse entrevoir le modèle R2 et présente une nouvelle méthode de passage à l'échelle de l'inférence, SPCT
DeepSeek
OpenAI
DeepSeek a publié une étude proposant la méthode Self-Principled Critique Tuning (SPCT) pour améliorer la scalabilité des modèles de récompense généraux lors de l'inférence. Parallèlement, la société a laissé entendre que son prochain modèle, R2, serait bientôt dévoilé, et devrait reposer sur des approches d'apprentissage par renforcement pur.
L'apprentissage profond par renforcement devient un facteur clé pour améliorer les grands modèles de langage après la phase de pré-entraînement, en particulier lors de la phase d'inférence. DeepSeek et des chercheurs de l'Université de Tsinghua ont proposé la méthode Self-Principled Critique Tuning (SPCT), qui comprend deux étapes : un rejection fine-tuning pour un démarrage à froid, permettant au modèle de générer des principes et des critiques dans le bon format, et un apprentissage par renforcement en ligne basé sur des règles pour une optimisation ultérieure. Pour un passage à l'échelle efficace, un échantillonnage parallèle est utilisé, et un meta-reward model aide à sélectionner la meilleure récompense. Les expériences ont montré que SPCT améliore considérablement la qualité et l'évolutivité des modèles de récompense généraux, surpassant les méthodes existantes. Parallèlement, la société a laissé entendre qu'elle développait la prochaine génération du modèle R2, qui utilisera probablement ces innovations. L'article note également que le paradigme de passage à l'échelle des LLM se déplace du pré-entraînement vers la post-formation et la phase d'inférence, comme l'a montré le modèle o1 d'OpenAI, qui génère une longue chaîne de raisonnement interne avant de répondre.
Source: Synced —
original
