DeepSeek évoque le modèle R2 et présente une nouvelle méthode de mise à l'échelle d'inférence, SPCT
DeepSeek
OpenAI
DeepSeek AI a publié un article sur la mise à l'échelle au moment de l'inférence pour les modèles de récompense généraux, introduisant SPCT (Self-Principled Critique Tuning). La société évoque son prochain modèle R2. La recherche aborde le problème de la rareté des récompenses et vise à améliorer l'évolutivité des modèles de récompense pendant l'inférence.
DeepSeek AI a publié un article intitulé « Inference-Time Scaling for Generalist Reward Modeling » présentant une nouvelle méthode appelée Self-Principled Critique Tuning (SPCT). SPCT améliore les modèles de récompense généralistes (GRM) en générant dynamiquement des principes et des critiques via un réglage par rejet et un apprentissage par renforcement en ligne basé sur des règles. Cette approche vise à améliorer l'évolutivité lors de l'inférence, en remédiant à la rareté des récompenses – un obstacle majeur à l'extension de l'apprentissage par renforcement pour les LLM. La série R1 de DeepSeek a déjà validé l'apprentissage par renforcement pur ; l'entreprise évoque désormais le modèle de nouvelle génération R2, qui devrait s'appuyer sur ces avancées. Le passage de l'évolutivité des LLM du pré-entraînement au post-entraînement, en particulier la phase d'inférence, fait suite à des modèles comme OpenAI o1, qui utilise un raisonnement interne approfondi en chaîne de pensée.
Source: Synced —
original
