Встречается на собеседованиях • сегодня
Как делается отбор признаков в задаче классификации
Отбор признаков (feature selection) помогает уменьшить размерность данных, улучшить интерпретируемость модели и избежать переобучения. Основные методы:
- Фильтрация (Filter methods) – отбор на основе статистических критериев (корреляция, ANOVA, хи-квадрат). Пример:
python
from sklearn.feature_selection import SelectKBest, chi2
X_new = SelectKBest(chi2, k=10).fit_transform(X, y)- Оберточные методы (Wrapper methods) – используют модель для оценки важности признаков (например, рекурсивное исключение RFE):
python
from sklearn.feature_selection import RFE
from sklearn.linear_model import LogisticRegression
rfe = RFE(estimator=LogisticRegression(), n_features_to_select=5)
X_rfe = rfe.fit_transform(X, y)- Встроенные методы (Embedded methods) – отбор внутри алгоритма (L1-регуляризация, feature_importances_):
python
from sklearn.ensemble import RandomForestClassifier
model = RandomForestClassifier()
model.fit(X, y)
importance = model.feature_importances_Также полезно анализировать мультиколлинеарность (VIF) и использовать domain knowledge. Для несбалансированных данных лучше применять методы, учитывающие дисбаланс (например, SelectFromModel с class_weight).

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы