النماذج 🇷🇺 27.07.2026 01:05

لماذا قد تخفي قيمة F1 الصغري البالغة 0.94 مصنفًا عديم الفائدة: تحليل مشكلة التصنيف متعدد التصنيفات

DeepPavlovDeepPavlov
باستخدام مثال الإشراف بواسطة الذكاء الاصطناعي لـ Discord، يوضح المقال أن مقياس F1 الصغري المجمع يمكن أن يخفي إخفاقات في الفئات النادرة ولكن الحرجة. يحذر المؤلف من اتباع مبدأ KISS (البساطة) بشكل أعمى في مهام التصنيف متعدد التصنيفات، ويشرح كيف يؤثر عدم توازن الفئات واختيار دالة الخسارة ومقاييس اختيار نقطة التفتيش على جودة النموذج الفعلية.
يُطوّر المؤلف نظام اعتدال للديسكورد يعتمد على نموذج ruBERT tiny2، مُضبطًا بدقة للتصنيف متعدد التصنيفات بـ15 تصنيفًا (SAFE، TOXIC، ADVERTISEMENT، SPAM، SCAM، THREAT، EVASION، FLOOD، وغيرها). تحتوي مجموعة البيانات على حوالي مليون مثال مُعلّم. بعد التدريب، حقق النموذج F1 الكلي على مجموعة الاختبار = 0.9358 وF1 الكلي الشامل = 0.8396 — وكان الفرق البالغ حوالي 0.1 إشارة إلى ضرورة فحص مقاييس كل تصنيف على حدة. اتضح أن التصنيفات النادرة (مثل EVASION الذي يحتوي على 35,000 عينة) تغرق في كتلة التصنيفات الشائعة (SAFE الذي يحتوي على 400,000 عينة)، وF1 الكلي لا يعكس الأخطاء عليها. لمكافحة عدم التوازن، تم استخدام pos_weight في دالة الخسارة BCEWithLogitsLoss. كشف التحليل التفصيلي أن TOXIC لديه استدعاء ≈0.78، مما يعني أن النموذج يفوّت جزءًا ملحوظًا من الرسائل السامة. تصنيفا FLOOD وIMAGE_SCAM غائبان تقريبًا في مجموعة الاختبار، لكن معالجتهما مُفوَّضة لمكونات نظام أخرى، وليس لمصنف النصوص. يلاحظ المؤلف أيضًا أن اختيار أفضل نقطة تفتيش بناءً على خسارة التدريب يؤدي إلى الإفراط في التجهيز: تم العثور على النسخة المثلى باستخدام F1 الكلي الشامل، وليس الخسارة. الخلاصة الرئيسية: مبدأ KISS ينطبق على التنفيذ، لكن ليس على المهمة — عدم توازن التصنيفات، اختلافات المقاييس، دقة واستدعاء منفصلان لكل تصنيف، وتكاليف الأخطاء لا يمكن تجاهلها. الخطوة التالية هي معايرة عتبات كل تصنيف على حدة.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة