Встречается на собеседованиях • сегодня
Как использовать модель бустинга в случае дисбаланса
Для дисбалансированных данных в бустинге (XGBoost, LightGBM, CatBoost) можно использовать:
- Параметр
scale_pos_weight(XGBoost) илиclass_weight- задает вес для положительного класса. Оптимальное значение обычноsum(negative) / sum(positive)
python
# XGBoost пример
model = XGBClassifier(scale_pos_weight=10) - Параметр
is_unbalanceв LightGBM:
python
model = LGBMClassifier(is_unbalance=True)-
Метрики: Используйте F1-score, ROC-AUC вместо accuracy
-
Сэмплинг: SMOTE/ADASYN перед обучением или параметры
subsample,colsample_by* -
Фокус-параметры:
max_delta_step(XGBoost) помогает при сильном дисбалансе
Важно валидировать на стратифицированных выборках и использовать кросс-валидацию с учетом дисбаланса (StratifiedKFold).

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы