Почему метрика Micro F1=0.94 может скрывать бесполезный классификатор: разбор multi-label задачи
В статье на примере AI-модерации Discord показано, что агрегированная метрика micro F1 может маскировать провалы на редких, но критически важных классах. Автор предупреждает об опасности слепого следования принципу KISS в multi-label задачах и объясняет, как дисбаланс классов, выбор loss-функции и метрики для выбора checkpoint влияют на реальное качество модели.
Автор разрабатывает AI-модерацию для Discord на основе модели ruBERT tiny2, дообученной для мультилейбл-классификации с 15 метками (SAFE, TOXIC, ADVERTISEMENT, SPAM, SCAM, THREAT, EVASION, FLOOD и другими). Датасет содержит около миллиона размеченных примеров. После обучения модель достигла микро F1=0.9358 и макро F1=0.8396 на тесте — разница почти в 0.1 сигнализировала о необходимости проверить
Показать ещё ↓
Источник: Habr — хаб NLP —
оригинал
