Опубликовано 8 дней назад

Инженер по оценке качества GenAI моделей (GenAI Evaluation Engineer) в ПАО Сбербанк Новосибирск

Building iconв офис
Money bag iconне указана

Сопроводительное письмо под эту вакансию

Софи напишет его под твоё резюме. Бесплатно — 5 писем в день.

Инженер по независимой оценке качества генеративных моделей Сбера (GigaChat, Kandinsky, GigaCode, PhysicalAI). Роль про измерение фундаментального качества моделей, разработку метрик, бенчмарков и eval-фреймворков, а не про их обучение.

Задачи:

  • Придумывать методологию измерения моделей: что измерять, на какой выборке, с чем сравнивать и какая разница считается значимой
  • Отвечать за достоверность измерений: отделять реальный прирост качества от прочих факторов, ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки
  • Разбираться в причинах ошибок моделей и превращать их в рекомендации командам разработки
  • Строить автоматическую оценку: разрабатывать LLM- и VLM-судей под конкретные задачи, создавать и дорабатывать библиотеки валидации полного цикла
  • Развивать общие для команд Банка фреймворки оценки и бенчмарки
  • Вести R&D: создавать новые методологии оценки качества, участвовать в развитии бенчмарков MERA, POLLUX и др., адаптировать мировые бенчмарки под банковские кейсы

Требования:

  • Умение проводить технический и научный ресерч: находить и критически разбирать статьи, бенчмарки, модели и реализации
  • Статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
  • Понимание современных AI-агентов и агентных систем: роли, инструменты, контекст, память, оркестрация
  • Понимание устройства генеративных моделей: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
  • Опыт с генеративными моделями и понимание подходов к их оценке: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
  • Продуктовое мышление: связывать тестирование с пользовательскими сценариями и понимать влияние результатов на релиз модели
  • Python на продакшн-уровне: чистый код по PEP 8, ООП, паттерны проектирования, аннотации типов, ruff, mypy; поддержка production-кода eval-пайплайнов и ревью чужого кода

Условия:

  • Годовая премия до 6 окладов и регулярный пересмотр зарплат
  • Гибкий формат удалённой работы на территории г. Новосибирска
  • Расширенный ДМС, льготное страхование для семьи
  • Более 400 образовательных программ СберУниверситета
  • DS&AI community (600+ специалистов, митапы, мастер-классы)
  • Корпоративный спортзал
  • Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • Подписка Прайм с возможностью совместного использования на трёх близких
  • Реферальная программа для сотрудников
  • Современный офис и гибридный формат, спортзал, снэки и кофе

Навыки:

  • Python
  • PEP 8
  • ООП
  • ruff
  • mypy
  • LLM
  • VLM
  • Model-as-a-judge
  • human evaluation
  • бенчмарки
  • RAG
  • LangGraph
  • Claude Code
  • Codex
  • Cursor
  • AI-assisted coding
  • статистика
  • дизайн эксперимента
  • AI-агенты
  • трансформеры
  • диффузионные модели
  • токенизация
Эту вакансию мы нашли в sber
ПАО Сбербанк

ПАО Сбербанк

Новосибирск

Получить оффер

Зарплата vs рынок

Зарплата не указана. Обычно на такой позиции платят 170 000 – 450 000 ₽, медиана 275 000 ₽.

85k275k1,0M

обычно платят (p25–p75): 170 000 – 450 000 ₽

Когорта Data · 660 вакансий за 90 дней

Зарплаты Data →

Похожие вакансии

Это единственная вакансия по вашему фильтру

Не то, что искал?

Автоотклики