RuGPT-3 XL 1.3B:n hienosäätö nykyaikaiselle kielimallitasolle ja vertailu Gemma3 1B:hen
Сбербанк
Google/DeepMind
Harrastaja hienosääti esikoulutetun ruGPT-3 XL 1.3B -mallin (vuodelta 2020) SFT:n ja DPO:n avulla nykyaikaiselle kielimallitasolle. Tuloksena saatua mallia verrataan vuoden 2025 Gemma3 1B -malliin; monissa testeissä ruGPT-3 XL osoitti tarkempia ja ytimekkäämpiä vastauksia, erityisesti logiikkatehtävissä ja Venäjän kulttuurin tuntemuksessa.
Kirjoittaja hienosääti vanhaa esikoulutettua mallia ruGPT-3 XL 1.3B, joka julkaistiin vuosina 2020–2021 ja osasi alun perin vain jatkaa tekstiä. SFT- (ohjattu hienosäätö) ja DPO-menetelmillä (suora preferenssioptimointi) hän muutti sen tehtäväorientoituneeksi suureksi kielimalliksi. SFT:hen käytettiin IlyaGusev/saiga_preferences-tietoaineistoa (30 000 tietuetta); koulutus kesti noin 1,5 tuntia yhden epookin ajan Hugging Facen SFTTrainerilla. Hienosäädön jälkeen malli oppi ymmärtämään kysymyksiä, antamaan oikeita vastauksia, noudattamaan dialogipohjaa ja päättämään generaation EOS-tokeniin. Kirjoittaja vertasi sitä myös moderniin Gemma3 1B -malliin (vuodelta 2025), joka on koulutettu kahdella biljoonalla tokenilla. Testeissä, jotka koskivat venäläisten rockyhtyeiden tuntemusta, monivaiheisia dialogeja, monimutkaisia fysiikan kysymyksiä, arvoituksia ja lyhyitä vastauksia, ruGPT-3 XL osoitti parempia tai vertailukelpoisia tuloksia, vaikka joissakin tehtävissä, kuten Linux-päätteen simuloinnissa, Gemma3 1B suoriutui paremmin. Lisäksi todetaan, että malli voi käyttää päättelyketjua parantaakseen vastausten laatua. Hienosäädön jälkeen malli muunnettiin GGUF-muotoon, jotta sitä on helppo käyttää llama.cpp:ssä.
Lähde: Habr — хаб ML —
Alkuperäinen
