Встречается на собеседованиях • сегодня

Что случится если обработать файл который не вмещается в память в pandas

Pandas попытается загрузить весь файл в оперативную память, что приведёт к ошибке MemoryError. Для обработки больших файтов есть несколько подходов:

  1. Использовать chunksize в pd.read_csv():
python
chunk_iter = pd.read_csv('large_file.csv', chunksize=10000)
for chunk in chunk_iter:
    process(chunk)  # ваша функция обработки
  1. Использовать более эффективные форматы:
python
df = pd.read_csv('large_file.csv')
df.to_parquet('compressed.parquet')  # занимает меньше места
  1. Использовать Dask или Modin - библиотеки с pandas-подобным API, работающие с данными, не помещающимися в память.

  2. Оптимизировать типы данных (например, category для строковых значений с малым числом уникальных значений).

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы