WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Сбер·Москва·2 дн назад

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

500 000 – 1 000 000 ₽
≈ 5,8 тыс.–11,5 тыс. $
🏢 ОфисLeadПолная занятость
500 000 – 1 000 000 ₽≈ 5,8 тыс.–11,5 тыс. $
Навык востребован (Python).
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online-RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели. Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

Чем предстоит заниматься

Разрабатывать и улучшать методы online-RL
Реализовывать и дорабатывать подходы post-training и online-RL
Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
Строить и развивать инфраструктуру обучения
Разрабатывать и поддерживать пайплайны online-RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
Работать с данными и системой оценки качества
Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
Брать на себя ответственность за целые куски системы: от идеи до результата в проде
Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества

Наши требования

Отличное владение Python и PyTorch
Практический опыт в LLM post-training: RLHF, online-RL, DPO или смежных направлениях
Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
Умение писать чистый, надёжный, production-ready код
Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места
Опыт работы с reward-моделями, process-reward-моделями, LLM-as-a-judge
Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач
Опыт работы с large-scale inference и оптимизацией генерации (vLLM, SGLang и т. д.)
Понимание современных open-source стеков для обучения LLM (verl, Megatron, TRL и др.)
Публикации, open-source-вклад или сильный прикладной track record

Мы предлагаем

Возможность выбрать удобный формат работы: гибрид или офис
Ежегодный пересмотр зарплаты, годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Ипотека выгоднее до 7% для каждого сотрудника
Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров
Вознаграждение за рекомендацию друзей в команду Сбера

Технологии и навыки

Python
PyTorch
Machine Learning
LLM
ML
VLLM
Сбер
Сбер
Москва

ГрейдLead
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано2 дн назад
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик в команду геосервисов автономного транспортаЯндексQA Lead в команду AI-агентов (Python)2ГИСPenetration Tester (Middle)KPMGЛидер команды R&D в MLСБЕР
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).