Встречается на собеседованиях • сегодня

Как обработать категориальные признаки

Для обработки категориальных признаков есть несколько основных методов:

  1. Label Encoding - присваивает каждой категории числовой код. Подходит для порядковых данных.
python
from sklearn.preprocessing import LabelEncoder
le = LabelEncoder()
df['category'] = le.fit_transform(df['category'])
  1. One-Hot Encoding - создает бинарные колонки для каждой категории. Лучше для номинальных данных без порядка.
python
pd.get_dummies(df, columns=['category'])
  1. Target Encoding - заменяет категории средним значением целевой переменной. Риск утечки данных.
python
from category_encoders import TargetEncoder
encoder = TargetEncoder()
df['category'] = encoder.fit_transform(df['category'], df['target'])
  1. Frequency Encoding - заменяет категории их частотой в данных.

Выбор метода зависит от типа данных, размера датасета и модели. Для деревьев часто хватает Label Encoding, для линейных моделей лучше One-Hot. Всегда проверяйте, не появились ли пропуски после кодирования.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы