Fine-tuning van ruGPT-3 XL 1.3B naar Modern LLM-niveau en Vergelijking met Gemma3 1B
Сбербанк
Google/DeepMind
Een enthousiasteling heeft het voorgetrainde model ruGPT-3 XL 1.3B (uit 2020) verfijnd met behulp van SFT en DPO naar het niveau van moderne LLM's. Het resulterende model wordt vergeleken met Gemma3 1B uit 2025; in veel tests toonde ruGPT-3 XL nauwkeurigere en beknoptere antwoorden, vooral bij logische taken en kennis van de Russische cultuur.
De auteur van het artikel heeft een oude pretrain-model ruGPT-3 XL 1.3B, uitgebracht in 2020-2021, verder getraind. Dit model kon oorspronkelijk alleen tekst aanvullen. Met behulp van SFT (Supervised Fine-Tuning) en DPO (Direct Preference Optimization) heeft hij het omgevormd tot een instructiegerichte LLM. Voor SFT werd de dataset IlyaGusev/saiga_preferences (30.000 records) gebruikt; de training duurde ongeveer 1,5 uur per epoch met behulp van de SFTTrainer van Hugging Face. Na de finetuning leerde het model vragen begrijpen, correcte antwoorden geven, de dialoogtemplate volgen en de generatie afsluiten met een EOS-token. De auteur heeft ook een vergelijking gemaakt met het moderne model Gemma3 1B (2025), getraind op 2 biljoen tokens. In tests over kennis van Russische rockbands, meerstapsdialogen, complexe natuurkundevragen, raadsels en korte antwoorden presteerde ruGPT-3 XL beter of vergelijkbaar, hoewel Gemma3 1B het in sommige taken, zoals het imiteren van een Linux-terminal, beter deed. Ook wordt opgemerkt dat het model een chain-of-thought (CoT) kan gebruiken om de kwaliteit van antwoorden te verhogen. Na de finetuning werd het model geconverteerd naar GGUF-formaat voor eenvoudig gebruik in llama.cpp.
Bron: Habr — хаб ML —
origineel
