Опубликовано 14 дней назад
Data Engineer (Стажер) в МегаФон Москва
Стажёр Data Engineer для работы с большими данными в экосистеме Hadoop и Oracle. Проектирование ETL/ELT процессов, оптимизация пайплайнов, интеграция источников данных.
Задачи:
- Проектирование и разработка отказоустойчивых ETL/ELT процессов в экосистеме Hadoop и Oracle
- Оптимизация и сопровождение пайплайнов данных (Spark, PySpark, Airflow)
- Интеграция новых источников данных и построение витрин для бизнес-заказчиков
- Обеспечение качества и актуальности данных в продуктивных системах
- Участие в архитектурных решениях по хранению и обработке больших данных
- Ad-hoc аналитика и поддержка команд аналитиков и data scientist
Требования:
- Высшее техническое образование (или завершающая стадия обучения)
- Опыт разработки на Python (написание скриптов, работа с библиотеками pandas, requests) от 6 месяцев (в т.ч. в рамках учебных проектов или стажировок)
- Уверенное знание SQL (написание сложных запросов, оконные функции, понимание планов выполнения, нормализация БД)
- Понимание основ архитектуры больших данных (понятия ETL/ELT, колоночные и реляционные хранилища, форматы хранения Parquet/ORC)
- Знакомство с концепциями оркестрации (Airflow) или опыт настройки простых пайплайнов в учебных целях
- Понимание принципов работы с системами контроля версий (Git) и умение работать в команде над кодом
- Базовые навыки работы в Linux (навигация по файловой системе, права доступа, простые bash-скрипты)
- Готовность к быстрому освоению технологий экосистемы Hadoop/Spark
- Навыки самостоятельного поиска информации и решения технических задач
- Опыт использования LLM-агентов и AI-ассистентов (например, Cursor, Claude Code) для генерации, рефакторинга и отладки инженерного кода
Навыки:
- Python
- pandas
- requests
- SQL
- Hadoop
- Oracle
- Spark
- PySpark
- Airflow
- Parquet
- ORC
- Git
- Linux
- bash
- LLM
- Cursor
- Claude Code
Эту вакансию мы нашли в Habr Career
МЕ
МегаФон
Москва
Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?