метрики по каждому классу отдельно. Оказалось, что редкие классы (например, EVASION с 35 000 примерами) тонут в массе частотных (SAFE с 400 000), и микро F1 не отражает ошибки на них. Для борьбы с дисбалансом использовался pos_weight в BCEWithLogitsLoss. Детальный анализ показал, что у TOXIC полнота (recall) ≈ 0.78, то есть модель пропускает заметную часть токсичных сообщений. Классы FLOOD и IMAGE_SCAM почти отсутствуют в тестовой выборке, но их обработка делегирована другим компонентам системы, а не текстовому классификатору. Автор также отмечает, что выбор лучшей контрольной точки на основе функции потерь на обучении ведёт к переобучению: оптимальный вариант был найден с использованием макро F1, а не функции потерь. Главный вывод: принцип KISS применим к реализации, но не к задаче — дисбаланс классов, различия в метриках, отдельные precision/recall для каждого класса и стоимость ошибок нельзя игнорировать. Следующий шаг — калибровка порогов для каждого класса в отдельности.