Опубликовано 4 дня назад

DevOps/Infrastructure Engineer (Matrix, self-hosted, KSA) в Doubletapp Екатеринбург

Building iconв офис
Person iconmiddle
Money bag iconдо 300 000 ₽/мес
Задачи:
  • Развёртывание платформы Matrix в изолированном (air-gapped) контуре заказчика в Kubernetes: Synapse + Synapse Workers, MAS, Element Web / Admin / Call, LiveKit, TURN/STUN, вспомогательные сервисы.
  • Подготовка внутреннего реестра образов и внутренних репозиториев пакетов, установка без обращения к внешним ресурсам, отключение внешней телеметрии компонентов.
  • Настройка четырёх контуров (dev / QA / UAT / prod) и CI/CD-пайплайнов сборки и выката, включая сборку и подпись форков клиентов (Web/Desktop, iOS, Android, Element Call, Element Admin) и собственный сервер обновлений.
  • Хранение конфигурации в репозитории и единый способ её применения на все контуры (IaC / GitOps).
  • Построение HA-конфигурации без единой точки отказа на двух compute-хостах и независимом quorum/witness-узле: PostgreSQL (Patroni, автопереключение, WAL-архивирование, PITR), Redis (Sentinel, AOF, eviction), S3-совместимое хранилище (MinIO/Ceph, шифрование at-rest, репликация между хостами), входной прокси (Nginx/HAProxy, минимум два экземпляра), LiveKit/TURN.
  • Резервное копирование и DR: копии PostgreSQL с WAL, файлового хранилища, конфигураций и секретов в независимое зашифрованное хранилище; регулярные проверки восстановления с фиксацией фактических RPO/RTO (целевые: RPO 0 при одиночном отказе, RPO бэкапа ≤ 15 мин, RTO ≤ 4 ч).
  • Разделение Synapse на специализированные воркеры (синхронизация, отправка событий, медиа, уведомления, фоновые задачи) и маршрутизация запросов на входном прокси; схема размещения процессов по узлам и горизонтальное масштабирование.
  • Развёртывание и настройка серверной части звонков: LiveKit SFU, сервис выдачи токенов, TURN/STUN, прохождение корпоративных NAT и мобильных сетей, UDP-тракт и качество медиа.
  • Интеграция корпоративной аутентификации на инфраструктурном уровне: MAS + OIDC, развёртывание и настройка IdP-моста (Keycloak / Authentik / Dex) для SAML/LDAP, MFA и правила сеансов.
  • Развёртывание доверенного шлюза проверки файлов (matrix-content-scanner, ClamAV/YARA, адаптер ICAP к антивирусу заказчика), карантинного контура и media proxy.
  • Мониторинг и наблюдаемость: метрики, журналы, дашборды Grafana, правила оповещений с покрытием Synapse, PostgreSQL, Redis, S3, LiveKit, TURN, входного прокси, очереди проверки файлов, SIEM-очереди и собственных сервисов; runbook-инструкции для дежурных.
  • Доставка JSON-журналов аудита в SIEM заказчика: персистентная очередь, повторная отправка, контроль потерь, алертинг; неизменяемое (WORM) хранилище журналов с настраиваемым сроком хранения.
  • Безопасность инфраструктуры: Zero-Trust и least privilege, шифрование внутренних соединений, default-deny NetworkPolicy, сегментация сети, контроль исходящих соединений с allowlist (только APNS/FCM и согласованные адреса), управление секретами и их ротация, hardening компонентов по чек-листу, сканирование уязвимостей и проверка конфигураций TLS / контейнеров / Kubernetes.
  • Устранение SPOF и подтверждение его независимыми failover-сценариями по каждому компоненту (compute-хост, PostgreSQL, Redis, S3, LiveKit/TURN, входной прокси, хранилище журналов).
  • Нагрузочное тестирование: базовый профиль 500 одновременно активных пользователей при 10 000 зарегистрированных (включая до 500 активных RTC-участников), резервный смешанный профиль на 750 пользователей; целевые p95 < 200 мс, доля ошибок < 1%; отчёты с p50/p95, throughput, error rate, CPU/RAM/disk IOPS/сеть по узлам.
  • Формирование требований к оборудованию и BOM, настройка dev/QA/UAT в инфраструктуре заказчика в КСА, установка производственной платформы на площадке заказчика; после перевозки оборудования в закрытый ЦОД — удалённый smoke test и проверка мониторинга (физического доступа к ЦОД нет).
  • Подготовка стенда и документации для независимого пентеста, разбор находок, устранение подтверждённых критических уязвимостей поставки, ретест.
  • Эксплуатационная документация на английском языке: инструкции развёртывания, обновления и откáта, runbook-и типовых аварий, регламент применения патчей; обучение системных администраторов, операторов и службы поддержки заказчика (train-the-trainer).
  • Поддержка 3-й линии в течение 12 месяцев гарантийного периода: реагирование на сбои по SLA (P1 < 4 ч / P2 < 24 ч / P3 < 72 ч), обновления безопасности и патчи, эксплуатационные изменения инфраструктуры.
Требования:
  • Опыт в DevOps/SRE/инфраструктурной инженерии от 4 лет.
  • Коммерческий опыт эксплуатации Matrix (Synapse/Dendrite/Element, MAS, Element Call/LiveKit) — обязательно.
  • Готовность к релокации в Саудовскую Аравию на 3 месяца (релокацию оплачиваем) — обязательно.
  • Kubernetes на уровне Senior: продакшн-эксплуатация, операторы, StatefulSet-нагрузки, NetworkPolicy, ingress, ресурсное планирование, отладка сетевого стека.
  • Опыт развёртывания в изолированных (air-gapped, on-premise) контурах: внутренний реестр образов (Harbor / Nexus / аналог), внутренние репозитории пакетов, работа без доступа к публичным registry.
  • IaC и GitOps: Helm, Kustomize, ArgoCD / FluxCD, Terraform и/или Ansible; конфигурация в репозитории и воспроизводимый выкат на несколько контуров.
  • CI/CD: GitLab CI / GitHub Actions / Jenkins; сборка и подпись артефактов, продвижение по контурам dev → QA → UAT → prod.
  • Глубокий опыт с PostgreSQL: streaming replication, Patroni (или аналогичный механизм автопереключения), DCS/witness, WAL-архивирование и PITR, оптимизация под нагрузку, тестирование восстановления.
  • Redis в HA-конфигурации: Sentinel / cluster / оператор, persistence (AOF), лимиты памяти и политики eviction, Pub/Sub как шина между воркерами.
  • Объектное хранилище: MinIO / Ceph / S3, шифрование at-rest, репликация и резервирование, object lock / WORM, retention и контроль ёмкости.
  • Nginx и/или HAProxy: терминация TLS 1.2/1.3, сертификаты корпоративного ЦС, балансировка, маршрутизация по эндпоинтам, rate limiting.
  • Мониторинг и логирование: Prometheus / VictoriaMetrics, Grafana, Alertmanager, Loki / OpenSearch; проектирование алертов и написание runbook-ов.
  • Резервное копирование и DR: проектирование схемы, независимые backup-таргеты, шифрование копий, регулярные restore-drill, работа с целевыми RPO/RTO.
  • Уверенное администрирование Linux и сетей: VLAN, маршрутизация, межсетевые экраны, LACP/бондинг, диагностика на 25GbE, работа с гипервизорами (KVM / Proxmox / VMware) на «железе» заказчика.
  • Информационная безопасность инфраструктуры: Zero-Trust и defense-in-depth на практике, mTLS между сервисами, default-deny сетевые политики, сегментация, контроль egress, управление секретами (Vault / Kubernetes Secret) и их ротация, hardening по CIS-бенчмаркам, сканирование образов и конфигураций (Trivy / Grype, kube-bench, testssl и аналоги).
  • Понимание принципов E2EE и криптографии в объёме, достаточном для корректного проектирования контура (что сервер видит и не видит, где заканчиваются возможности серверной проверки, как устроено хранение и передача ключей).
  • Опыт интеграции LDAP / AD и SSO (SAML 2.0 / OIDC) на стороне инфраструктуры: развёртывание и настройка Keycloak / Authentik / Dex или аналога.
  • Нагрузочное тестирование: k6 / Locust / JMeter (или аналоги), построение профиля нагрузки, интерпретация p50/p95, поиск узких мест, подготовка отчётов.
  • Python и/или Go на уровне чтения и правки чужого кода: конфигурация и патчи Synapse (Python/Twisted), LiveKit (Go), написание собственных скриптов, экспортеров и операторов автоматизации.
  • Разговорный английский (проект международный, коммуникация с заказчиком, вся документация и обучение — на английском).
  • Будет плюсом:

  • Опыт эксплуатации WebRTC-инфраструктуры: SFU (LiveKit / Janus / mediasoup), coturn, NAT traversal, отладка медиатракта.
  • Elasticsearch / OpenSearch.
  • Опыт интеграции ICAP / антивирусных решений (ClamAV, YARA).
  • Опыт с SIEM, compliance и аудитом (immutable/WORM-логи, доставка событий в SIEM заказчика).
  • Опыт на международных enterprise / госпроектах с повышенными требованиями к ИБ и в закрытых контурах без доступа в интернет.
  • Опыт подготовки инфраструктуры к внешнему пентесту и аудиту безопасности, устранения находок.
  • Опыт формирования требований к оборудованию и BOM, приёмки и ввода в эксплуатацию on-premise-платформ.
  • Опыт корпоративной дистрибуции мобильных приложений (MDM, Apple push-ключи, Firebase/FCM, собственный сервер обновлений desktop-клиентов).
  • Сертификации CKA / CKS.
  • Опыт работы на Ближнем Востоке или с арабоязычными заказчиками.
Условия:
  • Возможность трудоустройства в аккредитованной IT-компании в России.
  • Гибкий график, офис в центре Екатеринбурга либо возможность удаленной работы.
  • Работа с ведущими клиентами, международными проектами и современными технологиями.
  • Компенсация за занятия английским языком, оплачиваем 50% от стоимости уроков.
  • Больничный бюджет, который можно тратить на любые виды лечений и лекарств.
  • Неограниченный доступ к консультациям штатного юриста по личным вопросам.
Эту вакансию мы нашли в HH.ru
DO

Doubletapp

Екатеринбург

Получить оффер

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

вакансии джуниор
как откликнуться на вакансию
примеры вакансий junior
вакансии по QA
стажировки по QA
Автоотклики