損失収束は学習を意味しない:Tencent HunyuanがACL 2026でSFT訓練中の15.3%の「偽学習」サンプルを分析
Tencent
Tencent HunyuanはACL 2026で、教師ありファインチューニング(SFT)において損失収束がモデルの真の学習を保証しないことを示す研究を発表しました。彼らは訓練サンプルの15.3%が「偽学習」ケースであり、損失は低下するもののモデルが意図した知識を実際には獲得していないことを特定しました。この研究はこれらのサンプルを検出する方法を提供し、SFTの改善を提案しています。
テンセント・フンユエン(Tencent Hunyuan)は、ACL 2026で、教師ありファインチューニング(Supervised Fine-Tuning、SFT)における「偽の学習」現象を分析した研究を発表した。この研究により、トレーニング損失が収束しても、モデルが目的の知識を本当に学習していない可能性があることが明らかになった。SFTにおけるサンプルの15.3%でこの偽の学習が見られ、損失は減少するものの、モデルは一般化に失敗することがわかった。研究チームは、そのようなサンプルを特定する検出方法を開発し、偽の学習を軽減する手法を提案し、SFTの信頼性を向上させた。
出典: Tencent Hunyuan (GNews) —
原文
