Встречается на собеседованиях • сегодня
Как делить датасет на тестовую и обучающую часть
Разделение датасета на обучающую и тестовую части можно выполнить с помощью train_test_split из sklearn.model_selection. Обычно используют соотношение 70/30 или 80/20. Важно сохранить распределение классов при стратифицированном разбиении (если данные несбалансированы).
python
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(
X, y,
test_size=0.3,
random_state=42, # для воспроизводимости
stratify=y # стратификация по целевой переменной
)Если данных мало, лучше использовать кросс-валидацию (например, KFold). Для временных рядов важно сохранять порядок, используя TimeSeriesSplit.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы