模型研究 🇷🇺 13.08.2026 00:05

我如何未能让 Gemma 4 写出优美的俄语诗歌:关于过拟合与盲目指标的警示故事

Google/DeepMindGoogle/DeepMind
AI工程师 Daniil Sheremet 花费了一个月时间微调 Gemma 4,使其能够以正确的韵律和押韵创作俄语诗歌,但所有微调版本的表现均不如基础模型。真正的罪魁祸首并非模型本身,而是存在缺陷的评估流程:一个无法区分诗歌与散文的自定义评分器,以及一个关于重音符号的标记化问题。在修复评分器并进行适当的 A/B 测试后,基础模型胜出,这凸显了评估大语言模型输出结果的关键教训。
丹尼尔·谢列梅特,Agentic Lab 的一名AI工程师,花了一个月时间试图让Gemma 4写出符合抑扬格和押韵规则的俄语诗歌。他的计划涉及使用LoRA进行微调、一个批评-修订系统、约束解码以及其他技术。他构建了一个自定义诗歌扫描器,灵感来自Ilya Kozyrev的RPST工具,用于评估格律和押韵。他从ArsPoetica整理了一个数据集,创建了13342个带有控制标签的训练对。第一次LoRA运行(v1)生成了像“нагосты”和“гу́нты”这样的无意义词语,原因在于过度拟合以及训练目标中使用的重音标记导致了分词碎片化。第二次运行(v2)使用干净的目标和更低的学习率,生成的诗歌更连贯但仍然有缺陷,A/B测试表明它比基础模型更好。然而,评估评分器结果被证明是盲目的:它无法区分诗歌和散文,所有之前的排名都是噪声。在修复评分器后,使用了神经重音器(RUAccent)、更好的押韵检测和重新加权的指标,基础Gemma 4模型在平均分数和最佳4次分数上均击败了两个微调版本。微调模型优化了格律而牺牲了押韵,恰好学习了标签所强调的内容。这个故事强调了稳健评估的重要性,以及避免在微调中使用奇异的分词空间。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻