Model 🇷🇺 27.07.2026 01:05

Mengapa Micro F1=0,94 Mungkin Menyembunyikan Klasifier yang Tidak Berguna: Analisis Masalah Multi-Label

DeepPavlovDeepPavlov
Dengan menggunakan contoh moderasi AI untuk Discord, artikel ini menunjukkan bahwa metrik micro F1 yang teragregasi dapat menyembunyikan kegagalan pada kelas yang jarang tetapi kritis. Penulis memperingatkan agar tidak mengikuti prinsip KISS secara membabi buta dalam tugas multi-label dan menjelaskan bagaimana ketidakseimbangan kelas, pemilihan fungsi kerugian, dan metrik pemilihan checkpoint mempengaruhi kualitas model yang sebenarnya.
Penulis mengembangkan moderasi AI untuk Discord berdasarkan model ruBERT tiny2, yang disetel halus untuk klasifikasi multi-label dengan 15 label (SAFE, TOXIC, ADVERTISEMENT, SPAM, SCAM, THREAT, EVASION, FLOOD, dan lainnya). Dataset berisi sekitar 1 juta contoh berlabel. Setelah pelatihan, model mencapai F1 mikro uji=0,9358 dan F1 makro=0,8396 — perbedaan hampir 0,1 menandakan perlunya memeriksa metrik untuk setiap kelas secara individual. Ternyata kelas yang jarang (misalnya, EVASION dengan 35.000 sampel) tenggelam dalam massa kelas yang sering (SAFE dengan 400.000), dan F1 mikro tidak mencerminkan kesalahan pada kelas tersebut. Untuk mengatasi ketidakseimbangan, digunakan pos_weight dalam BCEWithLogitsLoss. Analisis terperinci mengungkapkan bahwa TOXIC memiliki recall≈0,78, yang berarti model melewatkan sebagian besar pesan beracun. Kelas FLOOD dan IMAGE_SCAM hampir tidak ada dalam split uji, tetapi pemrosesannya didelegasikan ke komponen sistem lain, bukan pengklasifikasi teks. Penulis juga mencatat bahwa memilih checkpoint terbaik berdasarkan loss pelatihan menyebabkan overfitting: varian optimal ditemukan menggunakan F1 makro, bukan loss. Kesimpulan utama: prinsip KISS berlaku untuk implementasi, tetapi tidak untuk tugas — ketidakseimbangan kelas, perbedaan metrik, presisi/recall terpisah untuk setiap kelas, dan biaya kesalahan tidak dapat diabaikan. Langkah selanjutnya adalah mengkalibrasi threshold untuk setiap kelas secara individual.
Sumber: Habr — хаб NLP — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru