Встречается на собеседованиях • сегодня
Использовал ли Apache Spark
Да, работал с Apache Spark для обработки больших данных. Основные задачи:
- Чтение/запись данных в форматах Parquet, CSV, JSON через
spark.readиdf.write. - Агрегации и трансформации с помощью
groupBy,agg,join. - Оптимизация через партиционирование (
repartition,coalesce) и кэширование (persist).
Пример для PySpark:
python
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("example").getOrCreate()
df = spark.read.parquet("data.parquet")
result = df.groupBy("category").agg({"value": "avg"})
result.show()Работал как в локальном режиме, так и в кластере (YARN). Для сложных пайплайнов использовал Spark SQL и UDF.

Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
офферы быстрее!
Попробовать бесплатно
Следующий вопрос
Это единственный вопрос по вашему фильтру
как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы