WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Что спрашивают
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервьюИгра «Путь джуна»
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
ML-инженер (AI Quality / Evaluation) в команду GigaChat
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. ML-инженер (AI Quality / Evaluation) в команду GigaChat

Сбер·Россия·16 июня

ML-инженер (AI Quality / Evaluation) в команду GigaChat

350 000 – 600 000 ₽
≈ 4 тыс.–6,9 тыс. $
🌍 УдалённоSeniorПолная занятость
350 000 – 600 000 ₽≈ 4 тыс.–6,9 тыс. $
88
Сильная вакансия
Платят на 71% выше медианы грейда, навык востребован (Python).
Нажмите на сигнал, чтобы увидеть, на чём он основан

Описание вакансии

Мы развиваем GigaChat и ищем сильного ML-инженера в команду AI Quality. Наша команда — это главный навигатор развития модели. Мы не просто тестируем сборки, мы исследуем новые возможности GigaChat, сопоставляем его работу с реальными продуктовыми требованиями и находим точки для кратного роста качества. Публичные бенчмарки покрывают далеко не всё и часто оторваны от жизни, поэтому мы строим собственную инфраструктуру замеров, которая честно показывает, как модель решает настоящие задачи пользователей.

Это роль для человека, который возьмёт на себя ответственность за сквозной цикл оценки: от ресёрча ландшафта и проектирования датасетов под продуктовые вызовы до написания надёжного кода и внедрения бенчмарка в общий харнесс. Ищем не столько исполнителя, собирающий дашборды, сколько мотивированного инженера-исследователя. Тот, кто глубоко понимает, что нужно продукту, замечает узкие места именного базового качества модели, вспоминает актуальную статью с подходящим методом оценки и приходит с готовым планом: «давайте замерим вот так, потому что именно это покажет наш реальный прогресс».

Чем предстоит заниматься

Развивать инфраструктуру и пайплайны замеров (Evaluation Harness).

Реализовывать и поддерживать бенчмарки: парсинг датасетов, промпт-шаблоны, постпроцессинг ответов, подсчёт метрик.
Обеспечивать железобетонную воспроизводимость: версионирование конфигов, CI-интеграция. Любой замер должен выдавать идентичный результат и сегодня, и через полгода.
Разбирать статьи и репозитории новых бенчмарков, понимать их методологию и встраивать в наш пайплайн с автоматическим запуском.

Строить и масштабировать LLM-as-a-Judge.

Развивать пайплайны моделей-судей: глубокий промпт-инжиниринг, калибровка, контроль смещений (bias), оценка консистентности и сравнение судей между собой.
Проектировать, настраивать и автоматизировать arena-style оценки.

Создавать целевые датасеты и анализировать данные.

Проектировать новые арены и тестовые наборы под конкретные слабые места модели и проверяемые гипотезы.
Вытаскивать сигналы о деградациях из пользовательских логов, собирать промпты, следить за актуальностью и контаминацией существующих датасетов.
Проводить аналитику и быстро писать скрипты для ответа на вопрос: «почему просела метрика и что именно сломалось».

Проводить research и влиять на релизы.

Самостоятельно отслеживать state-of-the-art в области evaluation, инициировать внедрение лучших подходов — не дожидаясь постановки задачи сверху.
Готовить аналитические отчёты по замерам, формулировать жёсткие go/no-go рекомендации и аргументированно отстаивать их перед командой pretrain/post-train.

Для нас важно

Уверенный Python и инженерная культура: код ревьюится, тестируется и не гниёт. Уверенное владение Git, CI/CD, Bash на уровне самостоятельной поддержки сервисов. Использование AI-ассистентов и знание best practices горячо приветствуются.
Глубокое понимание устройства LLM: не на уровне обзоров, а на практике. Вы знаете, что такое chat template, почему ризонеры могут давать разные результаты при нулевой температуре, и почему один и тот же бенчмарк можно замерить тремя способами, получив три разных числа. Практический опыт инференса open-source моделей (vLLM, SGLang).
Насмотренность и инициативность: вы умеете не просто следить за потоком статей, но в нужный момент вытащить из памяти релевантный подход, связать его с текущей задачей и конвертировать в конкретный план действий.
Базовая статистическая грамотность: доверительные интервалы, bootstrap, чёткое понимание того, когда разница в метрике статистически значима, а когда — это просто шум.
Будет плюсом
Опыт работы с evaluation-фреймворками (lm-evaluation-harness, HELM, BigCode Evaluation) или написания собственных харнессов.
Опыт с LLM-judge подходами и глубокое знакомство с профильной литературой (MT-Bench, AlpacaEval, Chatbot Arena).
Публикации или заметный open-source вклад в области evaluation.
Что предлагаем
Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
Огромную степень влияния на продукт: от ваших метрик и рекомендаций зависит, пойдет ли флагманская модель в релиз.
Команду сильных инженеров и исследователей, задающих высокую планку инженерной надёжности.
Конкурентную компенсацию, премии и расширенный соцпакет.

Технологии и навыки

Python
Git
CI/CD
Bash
Сбер
Сбер
Россия

ГрейдSenior
ЗанятостьПолная занятость
РегионРоссия
ФорматУдалённо
ИсточникСкрыто
Опубликовано16 июня
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Java разработчик (Кликстрим)ПАО Сбербанкдо 340 000 ₽NLP/LLM ResearcherПАО СбербанкProduct Manager в рекомендательных системахПАО СбербанкБизнес-аналитик/ Рroduct owner (Process Mining)ПАО Сбербанк
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).