Forschung 🇨🇳 30.07.2026 19:03

Loss-Konvergenz bedeutet nicht Lernen: Tencent Hunyuan ACL 2026 analysiert 15,3 % „falsche Lerner“-Stichproben im SFT-Training

TencentTencent
Tencent Hunyuan hat auf der ACL 2026 eine Studie veröffentlicht, die zeigt, dass während des überwachten Fine-Tunings (SFT) die Konvergenz des Losses nicht garantiert, dass das Modell tatsächlich gelernt hat. Sie identifizierten 15,3 % der Trainingsstichproben als „falsche Lerner“-Fälle, bei denen der Loss sinkt, das Modell jedoch nicht das beabsichtigte Wissen erwirbt. Die Forschung bietet eine Methode zur Erkennung dieser Stichproben und schlägt Verbesserungen für SFT vor.
Tencent Hunyuan präsentierte auf der ACL 2026 eine Forschungsarbeit, die das Phänomen des „falschen Lernens“ beim überwachten Feintuning (Supervised Fine-Tuning, SFT) analysiert. Die Studie zeigt, dass das Modell selbst dann, wenn der Trainingsverlust konvergiert, möglicherweise nicht wirklich das Zielwissen erlernt hat. Die Forscher fanden heraus, dass 15,3 % der Stichproben im SFT dieses falsche Lernen aufweisen, bei dem der Verlust abnimmt, das Modell jedoch nicht generalisiert. Das Team entwickelte eine Erkennungsmethode, um solche Stichproben zu identifizieren, und schlug Techniken vor, um falsches Lernen zu mildern und die Zuverlässigkeit des SFT zu verbessern.
Quelle: Tencent Hunyuan (GNews) — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten