Пытаемся заставить модели машинного обучения улавливать редкие, но доминирующие крайности. ⇐ Python
-
Anonymous
Пытаемся заставить модели машинного обучения улавливать редкие, но доминирующие крайности.
Введите описание изображения здесьЯ столкнулся с проблемой регрессии, когда редкие экстремальные значения доминируют над реальной целью, а все протестированные модели систематически их занижают. Входы – оконные статистические параметры рабочих сигналов; целью является пара упорядоченных глобальных экстремумов для каждого фиксированного окна, которые позже обрабатываются в усталостные повреждения (сильно нелинейные по амплитуде). Повышение градиента на основе гистограммы, XGBoost/LightGBM и линейные модели AR хорошо соответствуют массовому распределению (хорошее RMSE/R²), но постоянно сокращают верхний хвост даже после агрессивного взвешивания выборки (на основе диапазона, степенного закона, с учетом последовательности), пользовательских функций потерь, подчеркивающих ошибки хвоста (потеря гистограммы в лог-пространстве, явные штрафы за занижение прогноза), сокращение признаков на основе SHAP и более высокое временное разрешение. Задержки на уровне функций ухудшают прогнозирование хвоста. Существуют ли известные стратегии регрессии с учетом хвостов, целевые переформулировки или ограничения древовидного повышения, которые объясняют такое поведение, и какие подходы лучше работают для прогнозирования экстремальных значений?