Встречается на собеседованиях • сегодня
Что случится если обработать файл который не вмещается в память в pandas
Pandas попытается загрузить весь файл в оперативную память, что приведёт к ошибке MemoryError. Для обработки больших файтов есть несколько подходов:
- Использовать
chunksizeвpd.read_csv():
python
chunk_iter = pd.read_csv('large_file.csv', chunksize=10000)
for chunk in chunk_iter:
process(chunk) # ваша функция обработки- Использовать более эффективные форматы:
python
df = pd.read_csv('large_file.csv')
df.to_parquet('compressed.parquet') # занимает меньше места-
Использовать Dask или Modin - библиотеки с pandas-подобным API, работающие с данными, не помещающимися в память.
-
Оптимизировать типы данных (например,
categoryдля строковых значений с малым числом уникальных значений).

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы