Опубликовано 5 июня 2026 г.
Data Engineer+ML в TG @jobsearchhhhh удалённо
Data Engineer+ML Middle для работы с векторными хранилищами, ETL и LLM. Разработка сервисов обработки данных и обогащения больших языковых моделей.
Требования:
- Высокий уровень знаний языка программирования Python – структуры данных, итераторы и декораторы, параллельное и асинхронное программирование, объектно-ориентированное и функциональное программирование.
- Отличные знания SQL – создание сложных запросов с использованием табличных выражений (CTE) и оконных функций.
- Опыт работы с векторными хранилищами данных OpenSearch, Qdrant
- Опыт разработки сервисов пакетной и потоковой обработки данных для вычисления их векторного представления (embedding) и сохранения в векторном хранилище для обогащения больших языковых моделей (LLM) релевантными контекстными данными (RAG).
- Опыт работы в среде JupyterLab/JupyterHub.
- Опыт реализации промышленных отказоустойчивых сервисов ETL на Python для пакетной загрузки и трансформации данных под управлением Apache Airflow, Argo Workflows;
- Хорошие знания платформы Apache Spark – опыт использования библиотеки pyspark, влияние конфигурации приложения pyspark на производительность и эффективность обработки данных, отладка и анализ эффективности приложений pyspark с помощью Spark History Server.
- Опыт асинхронного программного взаимодействия с веб-сервисами по REST API с использованием библиотек – aiohttp, httpx.
- Хорошие знания и опыт использования реляционных баз данных Oracle, PostgreSQL
- Понимание особенностей обработки и хранения аналитических данных (OLAP), понимание отличий колоночных баз данных от строковых, знание колоночных форматов хранения данных – parquet, orc.
- Хорошие знания и опыт использования хранилищ больших данных – Hadoop/HDFS, S3, форматы таблиц Hive, Iceberg.
- Возраст до 45 лет
Условия:
- старт 31.07 (возможно раньше)
- привлечение 12 мес
- локация РФ
Навыки:
- Python
- SQL
- OpenSearch
- Qdrant
- JupyterLab
- JupyterHub
- ETL
- Apache Airflow
- Argo Workflows
- Apache Spark
- pyspark
- REST API
- aiohttp
- httpx
- Oracle
- PostgreSQL
- OLAP
- parquet
- orc
- Hadoop
- HDFS
- S3
- Hive
- Iceberg
- Apache Kafka
- Apache Flink
- aiokafka
- confluent-kafka
- kafka-python
Эту вакансию мы нашли в Telegram-канал @jobsearchhhhh
T@
TG @jobsearchhhhh
удалённо
Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?