Опубликовано 12 дней назад

Публикатор: Petruha Обсуждение: @devops_jobs #резюме #devops #sre #baremetal #llm в TG @sre_devops_jobs_rss удалённо

World iconудаленно
Person iconmiddle
Money bag iconне указана

Публикатор: Petruha
Обсуждение: @devops_jobs
#резюме #devops #sre #baremetal #llm

Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо

Обо мне:

Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.

Ключевое:

  • Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
  • Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.

  • Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.

  • Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль

  • Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".

  • Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.

  • После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.

Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant

Английский: C1

Контакт: @ptruha

Эту вакансию мы нашли в Telegram-канал @sre_devops_jobs_rss
T@

TG @sre_devops_jobs_rss

удалённо

Получить оффер

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

Автоотклики