Опубликовано 14 дней назад

LLMOps в KODE удалённо

World iconудаленно
Money bag icon170 000 – 230 000 ₽/мес

DevOps-инженер для эксплуатации и развития AI-платформы на Kubernetes с фокусом на LLM-инференс.

Задачи:

  • Развертывание, сопровождение и обновление LLM-инференс платформ (vLLM, SGLang, Ollama)
  • Эксплуатация и развитие AI-платформы в Kubernetes, включая масштабирование и управление GPU-ресурсами
  • Настройка AI Gateway (LiteLLM): маршрутизация запросов, API-ключи, квоты, лимиты и политики доступа
  • Оптимизация производительности inference: batching, KV Cache, semantic cache, снижение latency и стоимости инференса
  • Настройка мониторинга, логирования и трассировки (OpenTelemetry, Langfuse, SigNoz, Prometheus/Grafana)
  • Автоматизация CI/CD процессов для инфраструктуры и моделей, поддержка GitOps-подхода
  • Интеграция и сопровождение сервисов памяти, векторных хранилищ и компонентов RAG/Agentic AI
  • Диагностика и устранение инцидентов, обеспечение стабильности и высокой доступности LLM-платформы

Требования:

  • Опыт в роли DevOps от 3 лет
  • Опыт администрирования Kubernetes в production, Docker, Helm, понимание GitOps-подходов
  • Опыт эксплуатации LLM inference-серверов (vLLM, SGLang, Ollama или TGI) и понимание их архитектуры
  • Хорошее понимание принципов работы LLM: токены, KV Cache, batching, streaming, квантование, RAG
  • Практический опыт работы с GPU (NVIDIA/CUDA), распределением ресурсов и оптимизацией производительности
  • Опыт настройки мониторинга и observability (Prometheus, Grafana, OpenTelemetry, SigNoz/Langfuse)
  • Уверенные знания Linux, Docker, сетевого взаимодействия и диагностики инфраструктурных проблем
  • Навыки автоматизации на Python и работы с CI/CD (GitLab CI/GitHub Actions)
  • Опыт работы с Redis, PostgreSQL и API-шлюзами

Условия:

  • Удаленка, гибрид, офис
  • Полная занятость
  • Зарплатная вилка: от 170000 gross до 230000 gross
  • 2 этапа интервью

Навыки:

  • Kubernetes
  • Docker
  • Helm
  • GitOps
  • vLLM
  • SGLang
  • Ollama
  • TGI
  • LiteLLM
  • GPU
  • NVIDIA
  • CUDA
  • Prometheus
  • Grafana
  • OpenTelemetry
  • SigNoz
  • Langfuse
  • Python
  • GitLab CI
  • GitHub Actions
  • Redis
  • PostgreSQL
  • KEDA
  • Qdrant
  • Milvus
Эту вакансию мы нашли в Telegram-канал @sre_devops_jobs_rss
KO

KODE

удалённо

Получить оффер

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

Автоотклики