OnderzoekModellen 🇺🇸 28.07.2026 00:03

DeepSeek hint naar R2-model en introduceert nieuwe inferentieschalingmethode SPCT

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek heeft een studie gepubliceerd waarin de Self-Principled Critique Tuning (SPCT)-methode wordt voorgesteld om de schaalbaarheid van algemene beloningsmodellen tijdens inferentie te verbeteren. Tegelijkertijd hintte het bedrijf naar de aanstaande release van zijn volgende model, R2, dat naar verwachting gebaseerd zal zijn op pure versterkend leren-benaderingen.
Deep reinforcement learning wordt een cruciale factor voor het verbeteren van grote taalmodellen na de pre-trainingsfase, met name tijdens de inferentiefase. DeepSeek en onderzoekers van de Universiteit van Tsinghua hebben de Self-Principled Critique Tuning (SPCT)-methode voorgesteld, die uit twee fasen bestaat: rejection fine-tuning voor een koude start, waarmee het model principes en kritiek in de juiste indeling kan genereren, en op regels gebaseerde online reinforcement learning voor verdere optimalisatie. Voor efficiënte schaalvergroting wordt parallelle sampling gebruikt, en een meta-reward model helpt bij het selecteren van de beste beloning. Experimenten hebben aangetoond dat SPCT de kwaliteit en schaalbaarheid van algemene beloningsmodellen aanzienlijk verbetert, waarbij het bestaande methoden overtreft. Tegelijkertijd heeft het bedrijf gesuggereerd dat het werkt aan de volgende generatie van het R2-model, dat waarschijnlijk van deze innovaties gebruik zal maken. In het artikel wordt ook opgemerkt dat de schaalparadigma van large language models verschuift van pre-training naar post-training en de inferentiefase, zoals blijkt uit het o1-model van OpenAI, dat een lange interne redeneringsketen genereert voordat het antwoord geeft.
Bron: Synced — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws