Встречается на собеседованиях • сегодня
В чем разница между Apache Spark и pandas
Apache Spark — распределенная вычислительная система для обработки больших данных, работает в кластере. Pandas — однопоточная библиотека для анализа данных в памяти на одной машине.
Ключевые отличия:
- Масштаб: Spark обрабатывает ТБ/ПБ данных, pandas — до нескольких ГБ.
- Распределенность: Spark параллелит задачи на узлах кластера, pandas — только на CPU одной машины.
- Интерфейс: Spark использует RDD/DataFrame API (Python, Scala, Java, R), pandas — только Python.
- Ленивые вычисления: Spark оптимизирует запросы через DAG, pandas выполняет операции сразу.
Пример с кодом:
python
# Pandas (однопоточный)
df = pd.read_csv("large_file.csv")
df.groupby("category").sum()
# Spark (распределенный)
df = spark.read.csv("hdfs://large_file.csv")
df.groupBy("category").sum().show()Когда что использовать:
- Spark: Big Data, ETL-пайплайны, ML на кластере.
- Pandas: быстрый анализ на локальной машине, прототипирование.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы