Опубликовано 5 июня 2026 г.

Data Engineer+ML в TG @jobsearchhhhh удалённо

World iconудаленно
Person iconmiddle
Money bag iconне указана

Data Engineer+ML Middle для работы с векторными хранилищами, ETL и LLM. Разработка сервисов обработки данных и обогащения больших языковых моделей.

Требования:

  • Высокий уровень знаний языка программирования Python – структуры данных, итераторы и декораторы, параллельное и асинхронное программирование, объектно-ориентированное и функциональное программирование.
  • Отличные знания SQL – создание сложных запросов с использованием табличных выражений (CTE) и оконных функций.
  • Опыт работы с векторными хранилищами данных OpenSearch, Qdrant
  • Опыт разработки сервисов пакетной и потоковой обработки данных для вычисления их векторного представления (embedding) и сохранения в векторном хранилище для обогащения больших языковых моделей (LLM) релевантными контекстными данными (RAG).
  • Опыт работы в среде JupyterLab/JupyterHub.
  • Опыт реализации промышленных отказоустойчивых сервисов ETL на Python для пакетной загрузки и трансформации данных под управлением Apache Airflow, Argo Workflows;
  • Хорошие знания платформы Apache Spark – опыт использования библиотеки pyspark, влияние конфигурации приложения pyspark на производительность и эффективность обработки данных, отладка и анализ эффективности приложений pyspark с помощью Spark History Server.
  • Опыт асинхронного программного взаимодействия с веб-сервисами по REST API с использованием библиотек – aiohttp, httpx.
  • Хорошие знания и опыт использования реляционных баз данных Oracle, PostgreSQL
  • Понимание особенностей обработки и хранения аналитических данных (OLAP), понимание отличий колоночных баз данных от строковых, знание колоночных форматов хранения данных – parquet, orc.
  • Хорошие знания и опыт использования хранилищ больших данных – Hadoop/HDFS, S3, форматы таблиц Hive, Iceberg.
  • Возраст до 45 лет

Условия:

  • старт 31.07 (возможно раньше)
  • привлечение 12 мес
  • локация РФ

Навыки:

  • Python
  • SQL
  • OpenSearch
  • Qdrant
  • JupyterLab
  • JupyterHub
  • ETL
  • Apache Airflow
  • Argo Workflows
  • Apache Spark
  • pyspark
  • REST API
  • aiohttp
  • httpx
  • Oracle
  • PostgreSQL
  • OLAP
  • parquet
  • orc
  • Hadoop
  • HDFS
  • S3
  • Hive
  • Iceberg
  • Apache Kafka
  • Apache Flink
  • aiokafka
  • confluent-kafka
  • kafka-python
Эту вакансию мы нашли в Telegram-канал @jobsearchhhhh
T@

TG @jobsearchhhhh

удалённо

Получить оффер

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

Автоотклики