損失収束は学習を意味しない:Tencent HunyuanがACL 2026でSFT訓練中の15.3%の「偽学習」サンプルを解明
Tencent
Tencent HunyuanはACL 2026で発表した研究において、教師ありファインチューニング(SFT)において損失収束がモデルの真の学習を保証しないことを示しました。損失が低下してもモデルが意図した知識を実際に獲得していない「偽学習」ケースが訓練サンプルの15.3%を占めることを特定しました。この研究はこれらのサンプルを検出する方法を提供し、SFTの改善を提案しています。
テンセント・フンユエン(Tencent Hunyuan)は、ACL 2026で、教師ありファインチューニング(Supervised Fine-Tuning、SFT)における「偽の学習」現象を分析した研究を発表した。この研究により、トレーニング損失が収束しても、モデルが目的の知識を本当に学習していない可能性があることが明らかになった。SFTにおけるサンプルの15.3%でこの偽の学習が見られ、損失は減少するものの、モデルは一般化に失敗することがわかった。研究チームは、そのようなサンプルを特定する検出方法を開発し、偽の学習を軽減する手法を提案し、SFTの信頼性を向上させた。
出典: Tencent Hunyuan (GNews) —
原文
