تقارب الخسارة لا يعني التعلم: Tencent Hunyuan في ACL 2026 يكشف 15.3% من عينات "التعلم الزائف" في تدريب SFT
Tencent
نشرت Tencent Hunyuan دراسة في ACL 2026 تظهر أنه أثناء الضبط الدقيق الخاضع للإشراف (SFT)، لا يضمن تقارب الخسارة أن النموذج قد تعلم حقًا. حددوا أن 15.3% من عينات التدريب هي حالات "تعلم زائف" حيث تنخفض الخسارة لكن النموذج لا يكتسب المعرفة المقصودة فعليًا. يقدم البحث طريقة لاكتشاف هذه العينات ويقترح تحسينات لتدريب SFT.
قدمت Tencent Hunyuan بحثًا في مؤتمر ACL 2026 يحلل ظاهرة "التعلم الزائف" في الضبط الدقيق الخاضع للإشراف (SFT). تكشف الدراسة أنه حتى عندما يتقارب فقدان التدريب، قد لا يكون النموذج قد تعلم المعرفة المستهدفة حقًا. وجدوا أن 15.3% من العينات في SFT تُظهر هذا التعلم الزائف، حيث ينخفض الفقدان لكن النموذج يفشل في التعميم. طور الفريق طريقة كشف لتحديد هذه العينات واقترح تقنيات للتخفيف من التعلم الزائف، مما يحسن موثوقية SFT.
المصدر: Tencent Hunyuan (GNews) —
الأصلي
