Встречается на собеседованиях • сегодня

Согласен ли что бустинг является лидером в табличных данных

Бустинг (особенно XGBoost, LightGBM, CatBoost) действительно доминирует в табличных данных благодаря:

  • Высокой точности за счёт последовательного исправления ошибок
  • Умению работать с категориальными признаками и пропусками
  • Регуляризации для борьбы с переобучением

Пример сравнения в sklearn:

python
from sklearn.ensemble import RandomForestClassifier
from xgboost import XGBClassifier
from sklearn.metrics import accuracy_score

Для табличных данных XGBoost часто лучше

xgb = XGBClassifier().fit(X_train, y_train)
rf = RandomForestClassifier().fit(X_train, y_train)

print(f"XGBoost: {accuracy_score(y_test, xgb.predict(X_test)):.3f}")
print(f"RandomForest: {accuracy_score(y_test, rf.predict(X_test)):.3f}")

text

**Но есть нюансы:**  
- Для маленьких данных (n<10k) может проигрывать SVM/логистической регрессии  
- Требует тщательной настройки гиперпараметров  
- Медленнее линейных моделей в инференсе  

Вывод: бустинг — сильный baseline, но не панацея. Всегда проверяйте альтернативы.
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы