Pesquisa 🇨🇳 30.07.2026 19:03

Convergência de perda não significa aprendizado: Tencent Hunyuan ACL 2026 analisa 15,3% de amostras de "falso aprendizado" no treinamento SFT

TencentTencent
A Tencent Hunyuan publicou um estudo no ACL 2026 mostrando que, durante o fine-tuning supervisionado (SFT), a convergência da perda não garante que o modelo realmente aprendeu. Eles identificaram que 15,3% das amostras de treinamento são casos de "falso aprendizado", nos quais a perda diminui, mas o modelo não adquire o conhecimento pretendido. A pesquisa fornece um método para detectar essas amostras e sugere melhorias para o SFT.
A Tencent Hunyuan apresentou uma pesquisa no ACL 2026 analisando o fenômeno do "aprendizado falso" no ajuste fino supervisionado (SFT, do inglês supervised fine-tuning). O estudo revela que, mesmo quando a perda de treinamento converge, o modelo pode não ter aprendido verdadeiramente o conhecimento-alvo. Eles descobriram que 15,3% das amostras no SFT apresentam esse aprendizado falso, onde a perda diminui, mas o modelo falha em generalizar. A equipe desenvolveu um método de detecção para identificar tais amostras e propôs técnicas para mitigar o aprendizado falso, melhorando a confiabilidade do SFT.
Fonte: Tencent Hunyuan (GNews) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas