TutkimusMallit 🇷🇺 26.07.2026 21:04

RuGPT-3 XL 1.3B:n hienosäätö nykyaikaisen LLM:n tasolle ja vertailu Gemma3 1B:hen

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
Vanhaa ruGPT-3 XL 1.3B -mallia vuodelta 2020 hienosäädettiin SFT- ja DPO-menetelmillä, jolloin siitä tuli nykyaikainen ohjeita noudattava suuri kielimalli. Tulosta verrattiin vuoden 2025 Gemma3 1B -malliin, ja hienosäädetty ruGPT voitti Gemma3:n logiikassa ja luovuudessa, vaikka se kamppailee negatiivisten ohjeiden ja roolipelaamisen kanssa.
RuGPT-3 XL 1.3B -malli, joka alun perin oli vuodelta 2020 oleva esiopetettu malli ja kykeni vain jatkamaan tekstiä, hienosäädettiin valvotulla hienosäädöllä (SFT, Supervised Fine-Tuning) ja suoralla preferenssioptimoinnilla (DPO, Direct Preference Optimization) nykyaikaiseksi ohjeita noudattavaksi kielimalliksi. SFT:n jälkeen 42 miljoonan tokenin saiga_preferences-pohjaisella tietoaineistolla malli oppi noudattamaan ohjeita, vastaamaan kysymyksiin ja ylläpitämään monivuoroisia keskusteluja. Sitä verrattiin Gemma3 1B -malliin, joka on vuonna 2025 julkaistu ja 2 biljoonalla tokenilla koulutettu malli. Hienosäädetty ruGPT suoriutui paremmin tehtävistä, kuten venäläisten rock-yhtyeiden tuntemuksesta, monivaiheisista keskusteluista, kvanttifysiikan kysymyksistä ja spatiaalisesta arvoituksesta. Se käsitteli myös negatiivisia ohjeita (esim. tietyn sanan välttäminen) useiden uudelleenluontikertojen jälkeen, kun taas Gemma3 epäonnistui useimmissa tehtävissä lukuun ottamatta roolipelaamista ja pääte-emulointia, joissa ruGPT:llä oli vaikeuksia. DPO paransi edelleen mallin linjausta, vaikka artikkelissa huomautetaan, että pieni SFT-tietoaineisto rajoitti yleistyskykyä.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset