Встречается на собеседованиях • сегодня

Как использовать модель бустинга в случае дисбаланса

Для дисбалансированных данных в бустинге (XGBoost, LightGBM, CatBoost) можно использовать:

  1. Параметр scale_pos_weight (XGBoost) или class_weight - задает вес для положительного класса. Оптимальное значение обычно sum(negative) / sum(positive)
python
# XGBoost пример
model = XGBClassifier(scale_pos_weight=10) 
  1. Параметр is_unbalance в LightGBM:
python
model = LGBMClassifier(is_unbalance=True)
  1. Метрики: Используйте F1-score, ROC-AUC вместо accuracy

  2. Сэмплинг: SMOTE/ADASYN перед обучением или параметры subsample, colsample_by*

  3. Фокус-параметры: max_delta_step (XGBoost) помогает при сильном дисбалансе

Важно валидировать на стратифицированных выборках и использовать кросс-валидацию с учетом дисбаланса (StratifiedKFold).

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы