TutkimusMallit 🇺🇸 28.07.2026 00:03

DeepSeek vihjaa R2-mallista ja esittelee uuden päättelyn skaalausmenetelmän SPCT

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AI on julkaissut tutkimuspaperin päättelyajan skaalaamisesta yleisille palkkiomalleille, esitellen SPCT-menetelmän (Self-Principled Critique Tuning). Yritys vihjaa tulevasta R2-mallistaan. Tutkimus käsittelee palkkioiden niukkuutta ja pyrkii parantamaan palkkiomallien skaalautuvuutta päättelyn aikana.
DeepSeek AI julkaisi artikkelin 'Inference-Time Scaling for Generalist Reward Modeling', jossa esitellään uusi menetelmä nimeltä Self-Principled Critique Tuning (SPCT). SPCT parantaa yleisiä palkkiomalleja (general reward models, GRM) tuottamalla dynaamisesti periaatteita ja kritiikkejä hylkimishienosäädön (rejection fine-tuning) ja sääntöpohjaisen online-vahvistusoppimisen avulla. Menetelmän tavoitteena on parantaa skaalautuvuutta päättelyvaiheen aikana ja ratkaista palkkioharvuus (reward sparsity), joka on merkittävä este vahvistusoppimisen skaalaamisessa suurille kielimalleille (large language models, LLM). DeepSeekin R1-sarja on jo validoinut puhtaan vahvistusoppimisen koulutuksen; yritys viittaa nyt seuraavan sukupolven R2-malliin, jonka odotetaan rakentuvan näiden edistysaskelten pohjalle. LLM-skaalauksen painopisteen siirtyminen esikoulutuksesta jälkikoulutukseen, erityisesti päättelyvaiheeseen, seuraa mallien, kuten OpenAI:n o1:n, esimerkkiä, joka käyttää laajaa sisäistä ajatusketjupäättelyä (chain-of-thought reasoning).
Lähde: Synced — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset