Встречается на собеседованиях • сегодня

В чем разница между Apache Spark и pandas

Apache Spark — распределенная вычислительная система для обработки больших данных, работает в кластере. Pandas — однопоточная библиотека для анализа данных в памяти на одной машине.

Ключевые отличия:

  • Масштаб: Spark обрабатывает ТБ/ПБ данных, pandas — до нескольких ГБ.
  • Распределенность: Spark параллелит задачи на узлах кластера, pandas — только на CPU одной машины.
  • Интерфейс: Spark использует RDD/DataFrame API (Python, Scala, Java, R), pandas — только Python.
  • Ленивые вычисления: Spark оптимизирует запросы через DAG, pandas выполняет операции сразу.

Пример с кодом:

python
# Pandas (однопоточный)
df = pd.read_csv("large_file.csv")
df.groupby("category").sum()

# Spark (распределенный)
df = spark.read.csv("hdfs://large_file.csv")
df.groupBy("category").sum().show()

Когда что использовать:

  • Spark: Big Data, ETL-пайплайны, ML на кластере.
  • Pandas: быстрый анализ на локальной машине, прототипирование.
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы