Опубликовано вчера
QA ML/LLM в Цифровые привычки Москва
QA-инженер для тестирования LLM-агентов в проекте Сбера. Выстраивание системы оценки качества, автоматизация тестов, анализ инцидентов.
Задачи:
- Выстроить систему оценки качества ответов LLM-агентов (SQL-агент, агент анализа, агент визуализации): метрики, критерии, процесс.
- Развивать и сопровождать тестовые корзины для регрессионного тестирования: эталонные вопросы, ожидаемые SQL-запросы и ответы.
- Автоматизировать прогон тестов и оценку по бинарным критериям (валидность JSON, исполнимость SQL, отсутствие галлюцинаций, корректность ролевого доступа, консистентность ответов), в том числе через LLM Judge.
- Проводить сравнительное тестирование моделей и версий промптов, готовить отчёты для принятия решений.
- Тестировать релизы перед выводом в пром, выявлять расхождения поведения между тестовым и промышленным контурами.
- Анализировать инциденты качества в проме, локализовывать причины (промпт / модель / данные / код).
Требования:
- Опыт QA от 3 лет, в том числе тестирования ML/LLM-систем.
- Уверенный SQL (GreenPlum) — умение читать и проверять чужие запросы, находить логические ошибки.
- Python для автоматизации тестов и обработки результатов.
- Понимание специфики LLM: недетерминированность, галлюцинации, чувствительность к промптам.
- Опыт тестирования data-продуктов: витрины, ETL, качество данных.
- Знание банковской предметной области, финансовой отчётности (P&L) — будет плюсом.
- Опыт с фреймворками оценки LLM (Ragas, DeepEval) или построения своих, опыт с LangChain / LangGraph — будет плюсом.
Условия:
- Зарплата: от 200 000 до 250 000 ₽.
- Формат: первые 3 месяца в офисе, далее гибрид.
- Трудоустройство: ИП или ГПХ.
Навыки:
- SQL
- GreenPlum
- Python
- LLM
- Ragas
- DeepEval
- LangChain
- LangGraph
Эту вакансию мы нашли в Telegram-канал
ЦП
Цифровые привычки
Москва
Похожие вакансии
Это единственная вакансия по вашему фильтру
Не то, что искал?