Ajustement fin de ruGPT-3 XL 1.3B au niveau des LLM modernes et comparaison avec Gemma3 1B
Сбербанк
Google/DeepMind
Un passionné a affiné le modèle pré-entraîné ruGPT-3 XL 1.3B (de 2020) en utilisant SFT (Supervised Fine-Tuning) et DPO (Direct Preference Optimization) pour atteindre le niveau des LLM modernes. Le modèle obtenu est comparé à Gemma3 1B de 2025 ; dans de nombreux tests, ruGPT-3 XL a montré des réponses plus précises et concises, en particulier dans les tâches de logique et la connaissance de la culture russe.
L'auteur a affiné un ancien modèle pré-entraîné ruGPT-3 XL 1.3B, publié en 2020-2021, qui ne savait initialement que continuer le texte. Grâce aux méthodes SFT (Supervised Fine-Tuning, soit le réglage fin supervisé) et DPO (Direct Preference Optimization, soit l'optimisation directe des préférences), il l'a transformé en un LLM orienté instructions. Pour le SFT, un ensemble de données IlyaGusev/saiga_preferences (30 000 entrées) a été utilisé, l'apprentissage prenant environ 1,5 heure par époque avec SFTTrainer de Hugging Face. Après le réglage fin, le modèle a appris à comprendre les questions, à donner des réponses correctes, à respecter le modèle de dialogue et à terminer la génération par le jeton EOS. L'auteur a également effectué une comparaison avec le modèle moderne Gemma3 1B (2025), entraîné sur 2 billions de jetons. Dans les tests sur la connaissance des groupes de rock russes, les dialogues multi-tours, les questions complexes de physique, les énigmes et les réponses courtes, ruGPT-3 XL a montré des résultats meilleurs ou comparables, bien que dans certaines tâches, comme l'imitation d'un terminal Linux, Gemma3 1B ait mieux réussi. On note également que le modèle peut utiliser la chaîne de pensée (CoT) pour améliorer la qualité des réponses. Après le réglage fin, le modèle a été converti au format GGUF pour une utilisation pratique dans llama.cpp.
Source: Habr — хаб ML —
original
