Ajustement fin de ruGPT-3 XL 1.3B au niveau d'un LLM moderne et comparaison avec Gemma3 1B
Сбербанк
Google/DeepMind
L'ancien modèle ruGPT-3 XL 1.3B de 2020 a été affiné à l'aide des méthodes SFT et DPO, le transformant en un LLM moderne capable de suivre des instructions. Le résultat a été comparé avec le modèle Gemma3 1B de 2025, montrant que le ruGPT affiné surpasse souvent Gemma3 en logique et créativité, bien qu'il rencontre des difficultés avec les instructions négatives et le jeu de rôle.
Le modèle ruGPT-3 XL 1.3B, à l'origine un modèle pré-entraîné de 2020 capable uniquement de continuer du texte, a été affiné à l'aide du SFT (Supervised Fine-Tuning) et du DPO (Direct Preference Optimization) pour créer un LLM moderne capable de suivre des instructions. Après un SFT sur un ensemble de données de 42 millions de tokens tiré de saiga_preferences, le modèle a appris à suivre des instructions, répondre à des questions et maintenir des dialogues multi-tours. Il a ensuite été comparé à Gemma3 1B, un modèle de 2025 entraîné sur 2 billions de tokens. Le ruGPT affiné a obtenu de meilleurs résultats sur des tâches telles que la connaissance des groupes de rock russes, les conversations en plusieurs étapes, les questions de physique quantique et une énigme spatiale. Il a également géré des instructions négatives (par exemple, éviter un mot spécifique) après plusieurs tentatives de régénération, tandis que Gemma3 a échoué sur la plupart des tâches, à l'exception du jeu de rôle et de la simulation de terminal, où ruGPT a rencontré des difficultés. Le DPO a encore amélioré l'alignement, bien que l'article note que le petit ensemble de données SFT a limité la généralisation.
Source: Habr — хаб ML —
original
