研究 🇨🇳 30.07.2026 19:03

损失收敛不等于学习:腾讯混元ACL 2026剖析SFT训练中15.3%的“虚假学习”样本

TencentTencent
腾讯混元在ACL 2026上发表的一项研究表明,在监督微调(SFT)过程中,损失收敛并不能保证模型真正学到了知识。他们发现15.3%的训练样本属于“虚假学习”案例,即损失下降但模型并未实际获得预期知识。该研究提供了一种检测这些样本的方法,并提出了SFT的改进建议。
腾讯混元在ACL 2026上展示了关于监督微调(SFT)中“虚假学习”现象的研究。研究表明,即使训练损失收敛,模型也可能并未真正学会目标知识。他们发现SFT中15.3%的样本存在这种虚假学习,即损失下降但模型未能泛化。团队开发了一种检测方法来识别此类样本,并提出了缓解虚假学习的技术,提高了SFT的可靠性。
来源: Tencent Hunyuan (GNews) — 原文
我们之前关于此话题的帖子 ↓
最新新闻