OnderzoekModellen 🇺🇸 28.07.2026 00:03

DeepSeek hint op R2-model en introduceert nieuwe inferentie-schaalmethode SPCT

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AI heeft een paper gepubliceerd over inferentie-tijd schaling voor algemene beloningsmodellen, waarin SPCT (Self-Principled Critique Tuning) wordt geïntroduceerd. Het bedrijf hint op zijn aankomende R2-model. Het onderzoek richt zich op beloningsschaarste en streeft naar verbetering van de schaalbaarheid van beloningsmodellen tijdens inferentie.
DeepSeek AI publiceerde een paper met de titel 'Inference-Time Scaling for Generalist Reward Modeling' waarin een nieuwe methode wordt geïntroduceerd die Self-Principled Critique Tuning (SPCT) heet. SPCT verbetert algemene beloningsmodellen (GRM's) door dynamisch principes en kritieken te genereren via verwerpingsfijnafstemming en op regels gebaseerde online reinforcement learning. De aanpak streeft ernaar de schaalbaarheid tijdens de inferentiefase te verbeteren en zo beloningsschaarste aan te pakken—een grote hindernis bij het opschalen van reinforcement learning voor grote taalmodellen. DeepSeeks R1-serie heeft al zuivere RL-training gevalideerd; het bedrijf hint nu op het volgende generatiemodel R2, dat naar verwachting voortbouwt op deze ontwikkelingen. De verschuiving in LLM-schaalvergroting van pre-training naar post-training, met name de inferentiefase, volgt op modellen zoals OpenAI's o1, dat uitgebreid gebruikmaakt van interne chain-of-thought-redeneringen.
Bron: Synced — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws