تقارب الخسارة لا يعني التعلم: تينسنت هونيوان في ACL 2026 تحلل 15.3% من عينات "التعلم الزائف" في تدريب SFT
Tencent
نشرت تينسنت هونيوان دراسة في مؤتمر ACL 2026 تظهر أنه أثناء الضبط الدقيق الخاضع للإشراف (SFT)، لا يضمن تقارب الخسارة أن النموذج قد تعلم حقًا. حددوا أن 15.3% من عينات التدريب هي حالات "تعلم زائف" حيث تنخفض الخسارة لكن النموذج لا يكتسب المعرفة المقصودة بالفعل. يقدم البحث طريقة لكشف هذه العينات ويقترح تحسينات لـ SFT.
قدمت Tencent Hunyuan بحثًا في مؤتمر ACL 2026 يحلل ظاهرة "التعلم الزائف" في الضبط الدقيق الخاضع للإشراف (SFT). تكشف الدراسة أنه حتى عندما يتقارب فقدان التدريب، قد لا يكون النموذج قد تعلم المعرفة المستهدفة حقًا. وجدوا أن 15.3% من العينات في SFT تُظهر هذا التعلم الزائف، حيث ينخفض الفقدان لكن النموذج يفشل في التعميم. طور الفريق طريقة كشف لتحديد هذه العينات واقترح تقنيات للتخفيف من التعلم الزائف، مما يحسن موثوقية SFT.
المصدر: Tencent Hunyuan (GNews) —
الأصلي
