Встречается на собеседованиях • сегодня

Как вместить большую выборку в память для обучения модели CatBoost

Для работы с большими выборками в CatBoost можно использовать следующие подходы:

  1. Использование параметра has_time=True - CatBoost автоматически оптимизирует использование памяти при обработке временных данных.

  2. Загрузка данных порциями с помощью Pool.from_file():

python
train_pool = Pool.from_file('data.csv', delimiter=',', has_header=True)
  1. Уменьшение размера данных:
  • Удаление ненужных признаков
  • Использование категориальных признаков вместо строковых
  • Понижение точности числовых данных (float64 → float32)
  1. Использование параметров обучения:
python
model = CatBoostClassifier(
    iterations=500,
    learning_rate=0.05,
    depth=6,
    l2_leaf_reg=3,
    random_seed=42,
    task_type='GPU'  # Использование GPU для ускорения
)
  1. Выбор подходящего формата данных - CatBoost эффективнее работает с собственным форматом catboost_pool, чем с CSV.
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы