Встречается на собеседованиях • сегодня
Как делать разделение на выборки для подбора гиперпараметров
Для разделения данных на выборки при подборе гиперпараметров используйте k-fold кросс-валидацию или отдельную валидационную выборку.
- Train/Test/Val split:
- Разделите данные на обучающую (60-70%), валидационную (15-20%) и тестовую (15-20%) выборки.
- На валидационной выборке подбирайте гиперпараметры, а на тестовой — финальную оценку.
- K-Fold CV:
- Разбейте данные на K фолдов (обычно K=5 или 10).
- Обучайте модель на K-1 фолдах, валидируйте на оставшемся.
- Усредните метрики по всем фолдам.
Пример с train_test_split и GridSearchCV:
python
from sklearn.model_selection import train_test_split, GridSearchCV
from sklearn.ensemble import RandomForestClassifier
X_train, X_val, y_train, y_val = train_test_split(X, y, test_size=0.2, random_state=42)
param_grid = {'n_estimators': [50, 100], 'max_depth': [5, 10]}
model = GridSearchCV(RandomForestClassifier(), param_grid, cv=5)
model.fit(X_train, y_train)Важно: тестовая выборка не должна участвовать в подборе гиперпараметров!

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы