TutkimusMallit 🇺🇸 28.07.2026 00:03

DeepSeek vihjaa R2-mallista ja esittelee uuden päättelyn skaalausmenetelmän SPCT

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek on julkaissut tutkimuksen, jossa ehdotetaan Self-Principled Critique Tuning (SPCT) -menetelmää yleisten palkkiomallien skaalautuvuuden parantamiseksi päättelyn aikana. Samalla yritys vihjasi seuraavan mallinsa R2:n tulevasta julkaisusta, jonka odotetaan perustuvan puhtaisiin vahvistusoppimisen menetelmiin.
Syvä vahvistusoppiminen on tulossa keskeiseksi tekijäksi suurten kielimallien parantamisessa esikoulutusvaiheen jälkeen, erityisesti päättelyvaiheessa. DeepSeek ja Tsinghuan yliopiston tutkijat ovat ehdottaneet Self-Principled Critique Tuning (SPCT) -menetelmää, joka sisältää kaksi vaihetta: hylkäävän hienosäädön kylmäkäynnistykseen, jonka avulla malli pystyy tuottamaan periaatteita ja kritiikkiä oikeassa muodossa, sekä sääntöpohjaisen online-vahvistusoppimisen jatkooptimointia varten. Tehokasta skaalausta varten käytetään rinnakkaista otantaa, ja meta-palkkiomalli auttaa valitsemaan parhaan palkkion. Kokeet osoittivat, että SPCT parantaa merkittävästi yleisten palkkiomallien laatua ja skaalautuvuutta ylittäen olemassa olevat menetelmät. Samalla yritys vihjasi seuraavan sukupolven R2-mallin kehittämisestä, joka todennäköisesti hyödyntää näitä innovaatioita. Artikkelissa todetaan myös, että LLM:ien skaalausparadigma on siirtymässä esikoulutuksesta jälkikoulutukseen ja päättelyvaiheeseen, kuten OpenAIn o1-malli osoittaa, joka tuottaa pitkän sisäisen päättelyketjun ennen vastausta.
Lähde: Synced — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset