Встречается на собеседованиях • сегодня

Как делается отбор признаков в задаче классификации

Отбор признаков (feature selection) помогает уменьшить размерность данных, улучшить интерпретируемость модели и избежать переобучения. Основные методы:

  1. Фильтрация (Filter methods) – отбор на основе статистических критериев (корреляция, ANOVA, хи-квадрат). Пример:
python
from sklearn.feature_selection import SelectKBest, chi2
X_new = SelectKBest(chi2, k=10).fit_transform(X, y)
  1. Оберточные методы (Wrapper methods) – используют модель для оценки важности признаков (например, рекурсивное исключение RFE):
python
from sklearn.feature_selection import RFE
from sklearn.linear_model import LogisticRegression
rfe = RFE(estimator=LogisticRegression(), n_features_to_select=5)
X_rfe = rfe.fit_transform(X, y)
  1. Встроенные методы (Embedded methods) – отбор внутри алгоритма (L1-регуляризация, feature_importances_):
python
from sklearn.ensemble import RandomForestClassifier
model = RandomForestClassifier()
model.fit(X, y)
importance = model.feature_importances_

Также полезно анализировать мультиколлинеарность (VIF) и использовать domain knowledge. Для несбалансированных данных лучше применять методы, учитывающие дисбаланс (например, SelectFromModel с class_weight).

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы