Встречается на собеседованиях • сегодня

Для каких моделей предпочтителен One-Hot Encoding, а для каких нет

One-Hot Encoding (OHE) предпочтителен для линейных моделей (логистическая регрессия, линейная регрессия) и моделей, чувствительных к расстояниям (k-NN, SVM с ядрами), так как категории становятся независимыми бинарными признаками.

Не рекомендуется для:

  • Деревьев (Random Forest, XGBoost) — из-за роста размерности и разреженности данных.
  • Моделей с большим числом категорий — приводит к "проклятию размерности".

Альтернативы:

  • Label Encoding для деревьев (если порядок категорий не важен).
  • Target Encoding для высококардинальных признаков.

Пример OHE в Python:

python
import pandas as pd
from sklearn.preprocessing import OneHotEncoder

data = pd.DataFrame({'color': ['red', 'blue', 'green']})
encoder = OneHotEncoder(sparse=False)
encoded = encoder.fit_transform(data[['color']])
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы