Встречается на собеседованиях • сегодня

Как делить датасет на тестовую и обучающую часть

Разделение датасета на обучающую и тестовую части можно выполнить с помощью train_test_split из sklearn.model_selection. Обычно используют соотношение 70/30 или 80/20. Важно сохранить распределение классов при стратифицированном разбиении (если данные несбалансированы).

python
from sklearn.model_selection import train_test_split

X_train, X_test, y_train, y_test = train_test_split(
    X, y, 
    test_size=0.3, 
    random_state=42,  # для воспроизводимости
    stratify=y  # стратификация по целевой переменной
)

Если данных мало, лучше использовать кросс-валидацию (например, KFold). Для временных рядов важно сохранять порядок, используя TimeSeriesSplit.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы