Het fine-tunen van ruGPT-3 XL 1.3B naar een modern LLM-niveau en vergelijking met Gemma3 1B
Сбербанк
Google/DeepMind
Het oude ruGPT-3 XL 1.3B-model uit 2020 werd gefine-tuned met SFT- en DPO-methoden, waardoor het een moderne instructie-volgende LLM werd. Het resultaat werd vergeleken met het Gemma3 1B-model uit 2025, waaruit bleek dat de gefine-tunede ruGPT vaak beter presteert dan Gemma3 op het gebied van logica en creativiteit, hoewel het moeite heeft met negatieve instructies en rollenspellen.
Het ruGPT-3 XL 1.3B-model, oorspronkelijk een voorgetraind model uit 2020 dat alleen tekst kon voortzetten, werd gefinetuned met behulp van SFT (Supervised Fine-Tuning) en DPO (Direct Preference Optimization) om een moderne instructievolgende LLM te creëren. Na SFT op een dataset van 42 miljoen tokens, afgeleid van saiga_preferences, leerde het model instructies op te volgen, vragen te beantwoorden en meerluiksgesprekken te voeren. Vervolgens werd het vergeleken met Gemma3 1B, een model uit 2025 getraind op 2 biljoen tokens. Het gefinetunede ruGPT presteerde beter bij taken zoals kennis van Russische rockbands, meerstapsgesprekken, quantumfysicavragen en een ruimtelijk raadsel. Het ging ook om met negatieve instructies (bijv. het vermijden van een specifiek woord) na verschillende regeneratiepogingen, terwijl Gemma3 faalde bij de meeste taken behalve rollenspel en terminalemulatie, waar ruGPT moeite had. DPO verbeterde de afstemming verder, hoewel het artikel opmerkt dat de kleine SFT-dataset de generalisatie beperkte.
Bron: Habr — хаб ML —
origineel
