Код: Выделить всё
yesЯ хочу понять:
- Каковы наилучшие методы обработки несбалансированных наборов данных в этом случае?
- Следует ли мне использовать методы повторной выборки, такие как передискретизация (например, SMOTE) или недостаточная выборка?
- Или мне следует полагаться на методы уровня алгоритма, такие как веса классов?
- Как определить, какой метод лучше подходит для моего набора данных?
- Существует ли систематический способ сравнения подходы?
- Какие показатели оценки следует использовать?
- Точность кажется обманчивой из-за дисбаланса.
- Следует ли мне сосредоточиться на точности, отзыве, F1-оценке или ROC-AUC?
- Какой-либо рекомендуемый рабочий процесс или конвейер для решения такого типа проблем?