Convergentie van verlies betekent niet leren: Tencent Hunyuan ontleedt op ACL 2026 15,3% "vals leren"-monsters in SFT-training
Tencent
Tencent Hunyuan heeft op ACL 2026 een studie gepubliceerd waaruit blijkt dat tijdens supervised fine-tuning (SFT) convergentie van het verlies geen garantie biedt dat het model daadwerkelijk heeft geleerd. Ze identificeerden dat 15,3% van de trainingsmonsters 'vals leren' betreft: het verlies daalt, maar het model verwerft de beoogde kennis niet. Het onderzoek biedt een methode om deze monsters op te sporen en suggereert verbeteringen voor SFT.
Tencent Hunyuan presenteerde tijdens ACL 2026 onderzoek naar het fenomeen 'vals leren' bij supervised fine-tuning (SFT). De studie toont aan dat zelfs wanneer het trainingsverlies convergeert, het model mogelijk niet echt de beoogde kennis heeft geleerd. Ze ontdekten dat 15,3% van de samples in SFT dit valse leren vertoont, waarbij het verlies afneemt maar het model niet generaliseert. Het team ontwikkelde een detectiemethode om dergelijke samples te identificeren en stelde technieken voor om vals leren te beperken, waardoor de betrouwbaarheid van SFT verbetert.
Bron: Tencent Hunyuan (GNews) —
origineel
