模型研究 🇷🇺 26.07.2026 21:04

将 ruGPT-3 XL 1.3B 微调至现代大语言模型水平并与 Gemma3 1B 对比

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
一位爱好者使用监督微调和直接偏好优化将预训练模型 ruGPT-3 XL 1.3B(2020 年)微调至现代大语言模型水平。所得模型与 2025 年的 Gemma3 1B 进行了比较;在许多测试中,ruGPT-3 XL 展现出更准确和简洁的回答,尤其是在逻辑任务和俄罗斯文化知识方面。
作者对2020-2021年间发布的旧预训练模型ruGPT-3 XL 1.3B进行了微调,该模型最初仅能完成文本续写。通过监督微调(SFT)和直接偏好优化(DPO)方法,作者将其转变为指令导向的大型语言模型(LLM)。SFT使用了IlyaGusev/saiga_preferences数据集(3万条记录),借助Hugging Face的SFTTrainer,每个epoch的训练耗时约1.5小时。微调后,模型学会了理解问题、给出正确答案、遵循对话模板,并以EOS令牌结束生成。作者还将该模型与现代模型Gemma3 1B(2025年发布,基于2万亿个令牌训练)进行了对比。在俄罗斯摇滚乐队知识、多轮对话、复杂物理问题、谜题和简短回答等测试中,ruGPT-3 XL表现出色或与后者相当,尽管在某些任务(如模拟Linux终端)中Gemma3 1B表现更优。此外,模型还可利用思维链(CoT)提高回答质量。微调后,模型被转换为GGUF格式,以便在llama.cpp中便捷使用。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻