Встречается на собеседованиях • сегодня
Как от величины датасета меняется валидационная выборка
Размер валидационной выборки зависит от общего размера датасета. Для небольших датасетов (до 10k строк) рекомендуется использовать 20-30% данных для валидации. Для средних (10k-1M) достаточно 10-20%. Для больших (>1M) можно уменьшить до 1-5%, так как абсолютного числа примеров хватит для надежной оценки.
Пример кода для sklearn:
python
from sklearn.model_selection import train_test_split
# Для большого датасета (1M+ строк)
X_train, X_val, y_train, y_val = train_test_split(
X, y, test_size=0.05, random_state=42
)
# Для маленького датасета (1k строк)
X_train, X_val, y_train, y_val = train_test_split(
X, y, test_size=0.3, random_state=42
)Кросс-валидация предпочтительнее для маленьких датасетов, так как дает более стабильную оценку.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы