Встречается на собеседованиях • сегодня

С каким объемом данных приходилось работать

На практике работал с различными объемами данных – от небольших CSV (несколько МБ) до датасетов в несколько ГБ в форматах CSV, JSON, Parquet. Для обработки использовал:

  1. Pandas – оптимален для данных, помещающихся в оперативную память (до 10-15 ГБ на сервере с 32+ ГБ RAM)
  2. Dask – для распределенной обработки больших датасетов (50+ ГБ)
  3. PySpark – в кластерных средах (100+ ГБ)

Пример обработки большого CSV с помощью Pandas с оптимизацией:

python
import pandas as pd

# Чтение с указанием типов для экономии памяти
dtypes = {'user_id': 'int32', 'price': 'float32'}
df = pd.read_csv('large_data.csv', dtype=dtypes, chunksize=100000)

for chunk in df:
    # Постепенная обработка
    process_chunk(chunk)

Ключевые моменты:

  • Оптимизация типов данных (category, int32 вместо int64)
  • Использование итеративной обработки (chunksize)
  • Выбор подходящего инструмента под объем данных
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы