Обученный multi-label классификатор для модерации Discord показал высокий micro F1 (0.9358), но анализ отдельных метрик выявил низкий recall для класса TOXIC (около 0.78) и отсутствие положительных примеров для редких меток в test split.
Агрегированная метрика скрывает эти проблемы, а выбор checkpoint по macro F1 вместо training loss и учет весов классов через pos_weight при дисбалансе критически важны для оценки качества.