Опубликовано 2 дня назад

ML-инженер в команду online RL в ПАО Сбербанк Москва

Building iconв офис
Money bag iconне указана

Сопроводительное письмо под эту вакансию

Софи напишет его под твоё резюме. Бесплатно — 5 писем в день.

Сбер ищет ML-инженера в команду online RL для развития GigaChat. Роль предполагает проектирование и запуск экспериментов, построение пайплайнов обучения и улучшение качества модели.

Задачи:

  • Разрабатывать и улучшать методы online RL
  • Реализовывать и дорабатывать подходы post-training и online RL
  • Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты
  • Разбираться, почему модель стала лучше или хуже, оценивать устойчивость результата и возможность масштабирования
  • Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы
  • Строить и развивать инфраструктуру обучения
  • Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов до обновления весов модели
  • Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
  • Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование
  • Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями
  • Работать с данными и системой оценки качества
  • Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
  • Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
  • Анализировать ошибки модели, выявлять слабые места и формировать целевые обучающие выборки
  • Тесно взаимодействовать с исследователями, инженерами, командами данных и инфраструктуры
  • Брать ответственность за целые куски системы: от идеи до результата в проде
  • Делиться знаниями, участвовать в код-ревью, помогать поднимать планку качества

Требования:

  • Отличное владение Python и PyTorch
  • Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
  • Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
  • Умение писать чистый, надёжный, production-ready код
  • Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места

Условия:

  • Возможность выбрать удобный формат работы: гибрид или офис
  • Ежегодный пересмотр зарплаты, годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека выгоднее до 7% для каждого сотрудника
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • Вознаграждение за рекомендацию друзей в команду Сбера

Навыки:

  • Python
  • PyTorch
  • RLHF
  • online RL
  • DPO
  • Data Parallel
  • FSDP
  • DeepSpeed
  • GPU
  • distributed training
Эту вакансию мы нашли в sber
ПАО Сбербанк

ПАО Сбербанк

Москва

Получить оффер

Зарплата vs рынок

Зарплата не указана. Обычно на такой позиции платят 144 000 – 350 000 ₽, медиана 239 000 ₽.

83k239k600k

обычно платят (p25–p75): 144 000 – 350 000 ₽

Когорта Data · 582 вакансии за 90 дней

Зарплаты Data

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

Автоотклики