Встречается на собеседованиях • сегодня

Почему One-Hot Encoding плохо работает в случае алгоритма boosting

One-Hot Encoding может ухудшить производительность бустинговых алгоритмов (например, XGBoost, LightGBM, CatBoost) из-за:

  1. Разреженности данных — создает много фичей с нулями, что увеличивает размерность и замедляет обучение.
  2. Переобучения — особенно при высокой кардинальности категорий, так как бустинг чувствителен к шуму.
  3. Потери информации о взаимосвязях — бинарные фичи не сохраняют порядковые или иерархические связи.

Альтернативы:

  • Label Encoding (если порядок категорий не важен).
  • Target Encoding (для линейных зависимостей).
  • CatBoost — встроенная обработка категориальных фичей без явного кодирования.
python
# Пример с CatBoost (не требует OHE)
from catboost import CatBoostClassifier
model = CatBoostClassifier(cat_features=['category_column'])
model.fit(X_train, y_train)
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы