Modeller 🇷🇺 27.07.2026 01:05

Mikro F1=0.94 Neden İşe Yaramaz Bir Sınıflandırıcıyı Gizleyebilir: Çok Etiketli Bir Problem Analizi

DeepPavlovDeepPavlov
Discord için yapay zeka moderasyonu örneğini kullanan makale, toplu mikro F1 metriğinin nadir fakat kritik sınıflardaki başarısızlıkları gizleyebileceğini gösteriyor. Yazar, çok etiketli görevlerde KISS ilkesini körü körüne takip etmeye karşı uyarıyor ve sınıf dengesizliği, kayıp fonksiyonu seçimi ve kontrol noktası seçim metriklerinin gerçek model kalitesini nasıl etkilediğini açıklıyor.
Yazar, ruBERT tiny2 modeline dayalı olarak Discord için AI moderasyonu geliştiriyor; model, 15 etiketle (SAFE, TOXIC, ADVERTISEMENT, SPAM, SCAM, THREAT, EVASION, FLOOD ve diğerleri) çok etiketli sınıflandırma için ince ayar yapılmış. Veri seti yaklaşık 1 milyon etiketli örnek içeriyor. Eğitimden sonra model, test mikro F1=0.9358 ve makro F1=0.8396 elde etti; neredeyse 0.1'lik bir fark, her sınıf için metriklerin ayrı ayrı kontrol edilmesi gerektiğine işaret etti. Nadir sınıfların (örneğin, 35.000 örnekle EVASION) sık görülen sınıfların (400.000 örnekle SAFE) kitlesi içinde kaybolduğu ve mikro F1'in bu sınıflardaki hataları yansıtmadığı ortaya çıktı. Dengesizlikle mücadele etmek için BCEWithLogitsLoss içinde pos_weight kullanıldı. Detaylı analiz, TOXIC'te recall≈0.78 olduğunu, yani modelin zehirli mesajların önemli bir kısmını kaçırdığını ortaya koydu. FLOOD ve IMAGE_SCAM sınıfları test bölümünde neredeyse hiç yer almıyor, ancak bunların işlenmesi metin sınıflandırıcıya değil, sistemin diğer bileşenlerine devredilmiş durumda. Yazar ayrıca, eğitim kaybına dayalı olarak en iyi kontrol noktasını seçmenin aşırı öğrenmeye yol açtığını belirtiyor: en uygun varyant, kayıp değil, makro F1 kullanılarak bulundu. Ana çıkarım: KISS ilkesi uygulama için geçerlidir, ancak görev için geçerli değildir — sınıf dengesizliği, metrik farklılıkları, her sınıf için ayrı hassasiyet/duyarlılık ve hata maliyetleri göz ardı edilemez. Bir sonraki adım, her sınıf için eşikleri ayrı ayrı kalibre etmektir.
Kaynak: Habr — хаб NLP — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler