Опубликовано 5 дней назад
LLM Data Scientist в ПАО Сбербанк Москва
Сопроводительное письмо под эту вакансию
Софи напишет его под твоё резюме. Бесплатно — 5 писем в день.
Специалист по независимой оценке качества генеративных моделей GigaChat: разработка бенчмарков, LLM-судей и автоматических метрик, заключение по модельному риску. Не про обучение моделей, а про измерение их фундаментального качества.
Задачи:
- Развивать собственный фреймворк оценки LLM: писать чистый код, проводить код-ревью, поддерживать растущую кодовую базу
- Настраивать автоматизацию и CI, вести регулярную валидацию версий GigaChat и open-source альтернатив по единой методике
- Разрабатывать и актуализировать собственные бенчмарки под ключевые сценарии Банка: подбор задач, редкие и намеренно трудные случаи, эталонные ответы
- Превращать запрос «модель стала лучше?» в план проверки: что измеряем, на какой выборке, с чем сравниваем
- Строить LLM-судей и автоматические метрики, знать их перекосы (self-preference, position bias, length bias) и калибровать оценки против человеческих
- Оценивать автономность модели в сценарии и цену её ошибки, формулировать условия выпуска и защищать выводы перед командой разработки и руководством
- Следить за новыми подходами в научном сообществе, читать и писать статьи, внедрять лучшие практики оценки
- Создавать инструменты оценки самостоятельно, когда готового решения не существует
Требования:
- Python на продакшн-уровне: чистый код по PEP 8, ООП и паттерны проектирования, аннотации типов, линтеры и статический анализ (ruff, mypy)
- Опыт создания и поддержки production-кода eval-пайплайнов, чтение и ревью чужого кода
- Статистика и дизайн эксперимента: доверительные интервалы, оценка размера выборки, проверка гипотез, поправки на множественные сравнения, разница между статистической и практической значимостью
- Понимание устройства LLM изнутри: трансформер и механизм внимания, токенизация, параметры генерации, этапы обучения (предобучение, дообучение на инструкциях, обучение на человеческих предпочтениях)
- Опыт работы с LLM и понимание, как оценивают генеративные модели: метрики, human evaluation, LLM-as-a-judge и его ограничения
- Привычка выяснять цену ошибки до начала работы
- Готовность работать без готовой методологии, проактивность, умение декомпозировать большие задачи
Условия:
- Комфортный современный офис рядом с м. Кутузовская
- Возможность выбрать удобный график — офис / гибрид
- Ежегодный пересмотр зарплаты и годовая премия по итогам работы 2–4 оклада
- Программа адаптации и помощь руководителя на старте
- Более 400 образовательных программ СберУниверситета
- Корпоративный спортзал и зоны отдыха
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- Подписка Прайм с возможностью совместного использования на трех близких
- Скидки на продукты компаний-партнеров
- Вознаграждение за рекомендацию друзей в команду Сбера
Навыки:
- Python
- pandas
- NumPy
- PyTorch
- HuggingFace
- transformers
- datasets
- vLLM
- SGLang
- инференс-API
- S3
- Git
- Docker
- CI/CD
- Linux
- Bash
- ruff
- mypy
- LLM-as-a-judge
- human evaluation
- RAG
- векторный поиск
- эмбеддинги
- квантизация
- дистилляция
- PEFT/LoRA
- спекулятивное декодирование
- prompt engineering
- Claude Code
- Codex
- Cursor
Эту вакансию мы нашли в sber

ПАО Сбербанк
Москва
Зарплата vs рынок
Зарплата не указана. Обычно на такой позиции платят 160 000 – 440 000 ₽, медиана 270 000 ₽.
85k270k1,0M
обычно платят (p25–p75): 160 000 – 440 000 ₽
Когорта Data · 631 вакансия за 90 дней
Зарплаты Data →Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?