La convergence de la perte ne signifie pas l'apprentissage : Tencent Hunyuan ACL 2026 dissèque 15,3 % d'échantillons de « faux apprentissage » dans l'entraînement SFT
Tencent
Tencent Hunyuan a publié une étude à ACL 2026 montrant que lors du fine-tuning supervisé (SFT), la convergence de la perte ne garantit pas que le modèle ait vraiment appris. Ils ont identifié que 15,3 % des échantillons d'entraînement sont des cas de « faux apprentissage » où la perte diminue mais le modèle n'acquiert pas réellement les connaissances visées. La recherche fournit une méthode pour détecter ces échantillons et suggère des améliorations pour le SFT.
Tencent Hunyuan a présenté des recherches à l'ACL 2026 analysant le phénomène d'« apprentissage fallacieux » dans le fine-tuning supervisé (SFT). L'étude révèle que même lorsque la perte d'entraînement converge, le modèle peut ne pas avoir réellement appris les connaissances cibles. Ils ont constaté que 15,3 % des échantillons dans le SFT présentent cet apprentissage fallacieux, où la perte diminue mais le modèle ne parvient pas à généraliser. L'équipe a développé une méthode de détection pour identifier ces échantillons et proposé des techniques pour atténuer l'apprentissage fallacieux, améliorant ainsi la fiabilité du SFT.
Source: Tencent Hunyuan (GNews) —
original
