Обработка несбалансированной категориальной классификации (набор данных банковского маркетинга Португалии) – лучший подхPython

Программы на Python
Anonymous
Обработка несбалансированной категориальной классификации (набор данных банковского маркетинга Португалии) – лучший подх

Сообщение Anonymous »

Я работаю над проблемой категориальной классификации, используя набор маркетинговых данных португальских банков. Целевая переменная является двоичной ( / no), а набор данных сильно несбалансирован (гораздо больше нет, чем да).
Я хочу понять:
  • Каковы наилучшие методы обработки несбалансированных наборов данных в этом случае?
    • Следует ли мне использовать методы повторной выборки, такие как передискретизация (например, SMOTE) или недостаточная выборка?
    • Или мне следует полагаться на методы уровня алгоритма, такие как веса классов?
  • Как определить, какой метод лучше подходит для моего набора данных?
    • Существует ли систематический способ сравнения подходы?
  • Какие показатели оценки следует использовать?
    • Точность кажется обманчивой из-за дисбаланса.
    • Следует ли мне сосредоточиться на точности, отзыве, F1-оценке или ROC-AUC?
  • Какой-либо рекомендуемый рабочий процесс или конвейер для решения такого типа проблем?

Вернуться в «Python»