Встречается на собеседованиях • сегодня
Как обработать категориальные признаки
Для обработки категориальных признаков есть несколько основных методов:
- Label Encoding - присваивает каждой категории числовой код. Подходит для порядковых данных.
python
from sklearn.preprocessing import LabelEncoder
le = LabelEncoder()
df['category'] = le.fit_transform(df['category'])- One-Hot Encoding - создает бинарные колонки для каждой категории. Лучше для номинальных данных без порядка.
python
pd.get_dummies(df, columns=['category'])- Target Encoding - заменяет категории средним значением целевой переменной. Риск утечки данных.
python
from category_encoders import TargetEncoder
encoder = TargetEncoder()
df['category'] = encoder.fit_transform(df['category'], df['target'])- Frequency Encoding - заменяет категории их частотой в данных.
Выбор метода зависит от типа данных, размера датасета и модели. Для деревьев часто хватает Label Encoding, для линейных моделей лучше One-Hot. Всегда проверяйте, не появились ли пропуски после кодирования.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы