Встречается на собеседованиях • сегодня

Как отбираешь признаки для анализа при их большом количестве

Для отбора признаков при большом количестве фичей использую комбинацию методов:

  1. Статистические методы: ANOVA, корреляционный анализ, хи-квадрат для категориальных фич. Удаляю высококоррелированные признаки (threshold > 0.9).
python
from sklearn.feature_selection import SelectKBest, f_classif

selector = SelectKBest(f_classif, k=20)
X_new = selector.fit_transform(X, y)

text

2. **Feature importance** из моделей (RandomForest, XGBoost):
```python
from sklearn.ensemble import RandomForestClassifier

model = RandomForestClassifier()
model.fit(X, y)
importances = model.feature_importances_
  1. Методы понижения размерности: PCA, t-SNE для визуализации и отбора.

  2. Wrapper methods: Recursive Feature Elimination (RFE) с кросс-валидацией.

Важно учитывать:

  • Время вычислений (иногда проще взять топ-N фичей)
  • Интерпретируемость признаков
  • Доменные знания (иногда "плохие" статистически признаки критически важны для бизнеса)
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы