Встречается на собеседованиях • сегодня

Использовал ли Apache Spark

Да, работал с Apache Spark для обработки больших данных. Основные задачи:

  • Чтение/запись данных в форматах Parquet, CSV, JSON через spark.read и df.write.
  • Агрегации и трансформации с помощью groupBy, agg, join.
  • Оптимизация через партиционирование (repartition, coalesce) и кэширование (persist).

Пример для PySpark:

python
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("example").getOrCreate()
df = spark.read.parquet("data.parquet")
result = df.groupBy("category").agg({"value": "avg"})
result.show()

Работал как в локальном режиме, так и в кластере (YARN). Для сложных пайплайнов использовал Spark SQL и UDF.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы