Встречается на собеседованиях • сегодня

Как от величины датасета меняется валидационная выборка

Размер валидационной выборки зависит от общего размера датасета. Для небольших датасетов (до 10k строк) рекомендуется использовать 20-30% данных для валидации. Для средних (10k-1M) достаточно 10-20%. Для больших (>1M) можно уменьшить до 1-5%, так как абсолютного числа примеров хватит для надежной оценки.

Пример кода для sklearn:

python
from sklearn.model_selection import train_test_split

# Для большого датасета (1M+ строк)
X_train, X_val, y_train, y_val = train_test_split(
    X, y, test_size=0.05, random_state=42
)

# Для маленького датасета (1k строк)
X_train, X_val, y_train, y_val = train_test_split(
    X, y, test_size=0.3, random_state=42
)

Кросс-валидация предпочтительнее для маленьких датасетов, так как дает более стабильную оценку.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы