Встречается на собеседованиях • сегодня

Как делать разделение на выборки для подбора гиперпараметров

Для разделения данных на выборки при подборе гиперпараметров используйте k-fold кросс-валидацию или отдельную валидационную выборку.

  1. Train/Test/Val split:
    • Разделите данные на обучающую (60-70%), валидационную (15-20%) и тестовую (15-20%) выборки.
    • На валидационной выборке подбирайте гиперпараметры, а на тестовой — финальную оценку.
  1. K-Fold CV:
    • Разбейте данные на K фолдов (обычно K=5 или 10).
    • Обучайте модель на K-1 фолдах, валидируйте на оставшемся.
    • Усредните метрики по всем фолдам.

Пример с train_test_split и GridSearchCV:

python
from sklearn.model_selection import train_test_split, GridSearchCV
from sklearn.ensemble import RandomForestClassifier

X_train, X_val, y_train, y_val = train_test_split(X, y, test_size=0.2, random_state=42)
param_grid = {'n_estimators': [50, 100], 'max_depth': [5, 10]}
model = GridSearchCV(RandomForestClassifier(), param_grid, cv=5)
model.fit(X_train, y_train)

Важно: тестовая выборка не должна участвовать в подборе гиперпараметров!

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы