Встречается на собеседованиях • сегодня
Для каких моделей предпочтителен One-Hot Encoding, а для каких нет
One-Hot Encoding (OHE) предпочтителен для линейных моделей (логистическая регрессия, линейная регрессия) и моделей, чувствительных к расстояниям (k-NN, SVM с ядрами), так как категории становятся независимыми бинарными признаками.
Не рекомендуется для:
- Деревьев (Random Forest, XGBoost) — из-за роста размерности и разреженности данных.
- Моделей с большим числом категорий — приводит к "проклятию размерности".
Альтернативы:
- Label Encoding для деревьев (если порядок категорий не важен).
- Target Encoding для высококардинальных признаков.
Пример OHE в Python:
python
import pandas as pd
from sklearn.preprocessing import OneHotEncoder
data = pd.DataFrame({'color': ['red', 'blue', 'green']})
encoder = OneHotEncoder(sparse=False)
encoded = encoder.fit_transform(data[['color']])
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы