Опубликовано 19 дней назад
Data Engineer в TG @dstlab Москва
Data Engineer для работы с большими данными в финансовом департаменте. Разработка ETL-пайплайнов на Apache Spark, оптимизация процессов, взаимодействие с BI и DevOps.
Задачи:
- Разработка ETL на Apache Spark (Java стек)
- Разработка ETL-пайплайнов (Apache Spark, HDFS (parquets), Hive, Greenplum, ClickHouse)
- Разработка витрин данных в Greenplum и ClickHouse
- Оркестрация ETL-процессов
- Оптимизация ETL-процессов (батчинг, ретраи, SLA-контроль)
- Взаимодействие с BI-разработчиками и DevOps для своевременной доставки данных в Superset
Требования:
- Опыт работы с Apache Spark (Java) от 1 года - ОБЯЗАТЕЛЬНО
- Опыт работы с СУБД (Greenplum, ClickHouse, PostgreSQL) от 2 лет
- Опыт работы с Hadoop (HDFS, Hive)
- Опыт проектирования и разработки потоков данных, алгоритмов загрузки и обработки данных
- Опыт оптимизации ETL-пайплайнов и SQL кода
- Продвинутые знания SQL
- Понимание принципов работы распределенных систем
- Готовность осваивать Java для использования Spark
Условия:
- Поквартальная оплата
- Гибридный формат работы в Москве на Вавилова
- На старте 3 дня и более может быть в офисе, далее опционально
Навыки:
- Apache Spark
- Java
- Greenplum
- ClickHouse
- PostgreSQL
- Hadoop
- HDFS
- Hive
- Apache Airflow
- Python
- Qlik Sense
- Apache Superset
- PL/Pg SQL
- OpenShift
- Bitbucket
- Jira
- Confluence
- Docker
- Kubernetes
- Kibana
- Grafana
Эту вакансию мы нашли в Telegram-канал @dstlab
T@
TG @dstlab
Москва
Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?