Встречается на собеседованиях • сегодня
Расскажи про самый неуспешный рабочий ML-проект
Один из моих неудачных проектов — предсказание оттока клиентов для телеком-компании. Проблемы:
- Плохие данные — исторические записи были неполными (много NaN), а целевая переменная (факт ухода) определялась субъективно.
- Переобучение — несмотря на кросс-валидацию, модель (CatBoost) показывала 95% accuracy на тесте, но в продакшне её precision был около 60%. Клиенты без явных признаков оттока попадали в "группу риска".
- Неучтённый bias — данные содержали скрытую сезонность (пики оттока летом), но это проигнорировали при разбиении на train/test.
Выводы:
- Недооценил важность EDA и согласования метрик с бизнесом.
- Следовало делать временные срезы для валидации.
python
# Пример ошибки: train/test split без учёта времени
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3) # Так нельзя для временных данных!
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы