研究模型 🇷🇺 26.07.2026 21:04

将 ruGPT-3 XL 1.3B 微调至现代大语言模型水平,并与 Gemma3 1B 对比

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
来自2020年的古老 ruGPT-3 XL 1.3B 模型,通过 SFT 和 DPO 方法微调,转变为现代指令遵循大语言模型。结果与2025年的 Gemma3 1B 模型进行比较,显示微调后的 ruGPT 在逻辑和创造力方面常超越 Gemma3,但在负面指令处理和角色扮演方面存在困难。
ruGPT-3 XL 1.3B 模型最初是 2020 年发布的一款仅能续写文本的预训练模型,经过 SFT(监督微调)和 DPO(直接偏好优化)微调后,成为了一款能够遵循指令的现代大语言模型。在基于 saiga_preferences 构建的 4200 万 token 数据集上进行 SFT 后,该模型学会了遵循指令、回答问题以及维持多轮对话。随后,它与 Gemma3 1B(一款 2025 年发布的、基于 2 万亿 token 训练的模型)进行了比较。微调后的 ruGPT 在俄罗斯摇滚乐队知识、多轮对话、量子物理问题以及空间谜题等任务上表现更优。此外,经过多次重新生成尝试,它也能处理负面指令(例如避免使用某个特定词汇),而 Gemma3 除了角色扮演和终端模拟(ruGPT 在这些任务上表现不佳)外,在大多数任务上均未能通过。DPO 进一步提升了对齐效果,但文章指出,SFT 数据集规模较小限制了泛化能力。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻