Встречается на собеседованиях • сегодня

Расскажи про самый неуспешный рабочий ML-проект

Один из моих неудачных проектов — предсказание оттока клиентов для телеком-компании. Проблемы:

  1. Плохие данные — исторические записи были неполными (много NaN), а целевая переменная (факт ухода) определялась субъективно.
  2. Переобучение — несмотря на кросс-валидацию, модель (CatBoost) показывала 95% accuracy на тесте, но в продакшне её precision был около 60%. Клиенты без явных признаков оттока попадали в "группу риска".
  3. Неучтённый bias — данные содержали скрытую сезонность (пики оттока летом), но это проигнорировали при разбиении на train/test.

Выводы:

  • Недооценил важность EDA и согласования метрик с бизнесом.
  • Следовало делать временные срезы для валидации.
python
# Пример ошибки: train/test split без учёта времени
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)  # Так нельзя для временных данных!
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы