WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)

СБЕР·Москва·3 дн назад

Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)

🏢 ОфисMiddleПолная занятость
Зарплата не указана
Готовы вкладываться в обучение. Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка. Наша основная задача оценить флагманские генеративные модели Сбера – GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Чем предстоит заниматься

Придумывать, как вообще измерить модель
ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве
Отвечать за достоверность измерений
Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили
Разбираться в причинах ошибок
«Модель ошиблась» – это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация – в следующую версию модели, которая этой ошибки уже не делает
Строить автоматическую оценку
Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей
Строить то, чем пользуются другие
Фреймворки оценки, который вы развиваете – общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне

Наши требования

Умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов
Статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
Понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация
Понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
Опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
Продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели
Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой
R&D-опыт или участие в создании бенчмарков
Мультимодальные модели (изображения, видео, аудио)
Evaluation-фреймворки и harness
RAG
Работа с асессорами
Coding-агенты (Claude Code, Codex, Cursor)
Опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding
Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash

Мы предлагаем

Комфортный современный офис рядом с м. Кутузовская
Гибкий формат и удаленной работы, в т.ч. на территории РФ
Ежегодный пересмотр зарплаты и годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
Подписка Прайм с возможностью совместного использования на трёх близких
Скидки на продукты компаний-партнеров
Вознаграждение за рекомендацию друзей в команду Сбера

Дополнительно

Глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели
Критически рассматриваем архитектурные и методологические решения и предлагаем улучшения
Разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска
Проводим оценку логов пользователей для построения наиболее релевантного тестирования
Создание новых методологий оценки качества
Участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)
Адаптация передовых мировых бенчмарков под специфику банковских кейсов
И многое другое
Эта роль про независимое измерение фундаментального качества модели: не про их обучение – этим занимается отдельная команда

Технологии и навыки

Python
Docker
AI
Linux
Git
CI/CD
СБЕР
СБЕР
Москва

ГрейдMiddle
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано3 дн назад
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик в команду геосервисов автономного транспортаЯндексQA Lead в команду AI-агентов (Python)2ГИСTech Lead Java (GigaChat)СБЕРPenetration Tester (Middle)KPMG
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).