Опубликовано 2 дня назад
ML-инженер в команду online RL в ПАО Сбербанк Москва
Сопроводительное письмо под эту вакансию
Софи напишет его под твоё резюме. Бесплатно — 5 писем в день.
Сбер ищет ML-инженера в команду online RL для развития GigaChat. Роль предполагает проектирование и запуск экспериментов, построение пайплайнов обучения и улучшение качества модели.
Задачи:
- Разрабатывать и улучшать методы online RL
- Реализовывать и дорабатывать подходы post-training и online RL
- Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты
- Разбираться, почему модель стала лучше или хуже, оценивать устойчивость результата и возможность масштабирования
- Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы
- Строить и развивать инфраструктуру обучения
- Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов до обновления весов модели
- Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
- Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование
- Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями
- Работать с данными и системой оценки качества
- Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
- Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
- Анализировать ошибки модели, выявлять слабые места и формировать целевые обучающие выборки
- Тесно взаимодействовать с исследователями, инженерами, командами данных и инфраструктуры
- Брать ответственность за целые куски системы: от идеи до результата в проде
- Делиться знаниями, участвовать в код-ревью, помогать поднимать планку качества
Требования:
- Отличное владение Python и PyTorch
- Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
- Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
- Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
- Умение писать чистый, надёжный, production-ready код
- Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места
Условия:
- Возможность выбрать удобный формат работы: гибрид или офис
- Ежегодный пересмотр зарплаты, годовая премия
- Корпоративный спортзал и зоны отдыха
- Более 400 образовательных программ СберУниверситета
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- Ипотека выгоднее до 7% для каждого сотрудника
- Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- Вознаграждение за рекомендацию друзей в команду Сбера
Навыки:
- Python
- PyTorch
- RLHF
- online RL
- DPO
- Data Parallel
- FSDP
- DeepSpeed
- GPU
- distributed training
Эту вакансию мы нашли в sber

ПАО Сбербанк
Москва
Зарплата vs рынок
Зарплата не указана. Обычно на такой позиции платят 144 000 – 350 000 ₽, медиана 239 000 ₽.
83k239k600k
обычно платят (p25–p75): 144 000 – 350 000 ₽
Когорта Data · 582 вакансии за 90 дней
Зарплаты Data →Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?