Встречается на собеседованиях • сегодня

Как отобрать признаки для модели

Отбор признаков помогает улучшить качество модели, ускорить обучение и избежать переобучения. Основные методы:

  1. Фильтрация по корреляции – удаляем сильно коррелирующие признаки (например, corr > 0.9).
python
corr_matrix = df.corr().abs()
upper = corr_matrix.where(np.triu(np.ones_like(corr_matrix), k=1).astype(bool))
to_drop = [col for col in upper.columns if any(upper[col] > 0.9)]
df.drop(to_drop, axis=1, inplace=True)
  1. Важность признаков – используем встроенные методы моделей (например, feature_importances_ в RandomForest).

  2. Методы обёртки (Wrapper) – например, Recursive Feature Elimination (RFE).

  3. Встроенные методы (Embedded) – L1-регуляризация (Lasso) автоматически обнуляет неважные веса.

  4. Статистические тесты – ANOVA, хи-квадрат для категориальных признаков.

Пример для SelectKBest:

python
from sklearn.feature_selection import SelectKBest, f_classif
selector = SelectKBest(f_classif, k=10)
X_new = selector.fit_transform(X, y)

Выбор метода зависит от данных и задачи. Часто комбинируют несколько подходов.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы