Ajuste fino do ruGPT-3 XL 1.3B ao nível de LLM moderno e comparação com Gemma3 1B
Сбербанк
Google/DeepMind
Um entusiasta ajustou o modelo pré-treinado ruGPT-3 XL 1.3B (de 2020) usando SFT (Ajuste Fino Supervisionado) e DPO (Otimização Direta de Preferência) para o nível de LLM moderno. O modelo resultante foi comparado com o Gemma3 1B de 2025; em muitos testes, o ruGPT-3 XL apresentou respostas mais precisas e concisas, especialmente em tarefas de lógica e conhecimento da cultura russa.
O autor do artigo fez fine-tuning em um modelo pré-treinado antigo, o ruGPT-3 XL 1.3B, lançado entre 2020 e 2021, que originalmente só sabia continuar texto. Usando os métodos SFT (Supervised Fine-Tuning, Fine-Tuning Supervisionado) e DPO (Direct Preference Optimization, Otimização Direta de Preferências), ele o transformou em um LLM (Large Language Model, Modelo de Linguagem de Grande Porte) orientado a instruções. Para o SFT, foi utilizado o dataset IlyaGusev/saiga_preferences (30 mil registros), e o treinamento levou cerca de 1,5 horas por época com o SFTTrainer da Hugging Face. Após o fine-tuning, o modelo aprendeu a entender perguntas, dar respostas corretas, seguir o template de diálogo e finalizar a geração com o token EOS. O autor também fez uma comparação com o modelo moderno Gemma3 1B (de 2025), treinado em 2 trilhões de tokens. Em testes sobre conhecimento de bandas de rock russas, diálogos de múltiplas etapas, perguntas complexas de física, enigmas e respostas curtas, o ruGPT-3 XL apresentou resultados melhores ou comparáveis, embora em algumas tarefas, como simular um terminal Linux, o Gemma3 1B tenha se saído melhor. Também é observado que o modelo pode usar cadeia de raciocínio (Chain of Thought, CoT) para melhorar a qualidade das respostas. Após o fine-tuning, o modelo foi convertido para o formato GGUF para facilitar o uso no llama.cpp.
Fonte: Habr — хаб ML —
original
