Встречается на собеседованиях • сегодня
Согласен ли что бустинг является лидером в табличных данных
Бустинг (особенно XGBoost, LightGBM, CatBoost) действительно доминирует в табличных данных благодаря:
- Высокой точности за счёт последовательного исправления ошибок
- Умению работать с категориальными признаками и пропусками
- Регуляризации для борьбы с переобучением
Пример сравнения в sklearn:
python
from sklearn.ensemble import RandomForestClassifier
from xgboost import XGBClassifier
from sklearn.metrics import accuracy_score
Для табличных данных XGBoost часто лучше
xgb = XGBClassifier().fit(X_train, y_train)
rf = RandomForestClassifier().fit(X_train, y_train)
print(f"XGBoost: {accuracy_score(y_test, xgb.predict(X_test)):.3f}")
print(f"RandomForest: {accuracy_score(y_test, rf.predict(X_test)):.3f}")
text
**Но есть нюансы:**
- Для маленьких данных (n<10k) может проигрывать SVM/логистической регрессии
- Требует тщательной настройки гиперпараметров
- Медленнее линейных моделей в инференсе
Вывод: бустинг — сильный baseline, но не панацея. Всегда проверяйте альтернативы.
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы