WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Что спрашивают
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Reinforcement Learning Engineer
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Reinforcement Learning Engineer

Сбер·Москва·1 дн назад

Reinforcement Learning Engineer

🏢 ОфисJuniorПолная занятость
Зарплата не указана
62
Хорошие условия
Навык востребован (Python), за такой навык на рынке платят больше. Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

В Центре Робототехники Сбера мы строим антропоморфного робота общего назначения. Наш робот вышел из стадии первых демонстраций — и мы переходим к надёжной автономной работе в реальных задачах. Локомоция и управление всем телом (Whole Body Control) — основа этой работы: именно от них зависит, насколько устойчиво и предсказуемо робот движется в реальном мире. Мы ищем инженера, который разрабатывает, обучает и доводит до робота RL-политики управления всем телом — от постановки задачи в симуляторе до стабильной работы контроллера на железе. Это роль для того, кто хочет видеть результат своих алгор

О роли

Наша команда действительно работает над уникальным проектом в России, а у Вас будет прямой доступ к железу, Вы будете видеть результат своей работы в физическом мире.

Чем предстоит заниматься

Разрабатывать, обучать и деплоить RL-политики локомоции и whole body control
Подбирать observations, actions и типы моделей, которые дают максимальную производительность
Находить и закрывать ключевые факторы в sim-to-real gap — добиваться, чтобы политика, обученная в симуляторе, работала на реальном роботе
Определять, измерять и интерпретировать метрики качества обученных политик
Доводить control stack до стабильной и предсказуемой работы в реальных условиях
Настраивать reward-функции, domain randomization и curriculum под конкретные двигательные задачи
Работать в связке с командами интеграции и middleware — доводить политику до надежного исполнения на железе

Наши требования

Уверенное владение Python; знание C++ как плюс для интеграции на робота
Опыт применения RL-алгоритмов для робототехники или управления (PPO, SAC и подобные)
Понимание динамики и управления, в идеале — шагающих роботов
Опыт подбора гиперпараметров и cost/reward-функций для RL
Знакомство с типовыми техниками RL: domain randomization, curriculum learning, reward shaping
Опыт работы с симуляторами (MuJoCo, Isaac Sim или аналоги)
Способность самостоятельно разбираться в незнакомых системах и находить корневые причины проблем
Желание брать ответственность за то, что политика работает на роботе, а не только в симуляторе
Опыт деплоя обученных политик на реальное железо
Опыт с behavior cloning и дистилляцией политик
Понимание основ теории управления, кинематики и динамики шагающих роботов
Опыт работы с middleware робота (ROS2, DDS)
Опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов

Мы предлагаем

Комфортный современный офис г. Москва, МЦК ЗИЛ
Формат работы - лаборатория робототехники
Ежегодный пересмотр зарплаты, годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
Программа адаптации и помощь руководителя на старте (для вакансий уровня Junior)
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
Подписка Прайм с возможностью совместного использования на трёх близких
Вознаграждение за рекомендацию друзей в команду Сбера

Дополнительно

Python, PyTorch, RL (PPO/SAC), MuJoCo/Isaac Sim, ONNX, C++, ROS2

Технологии и навыки

Python
C++
AI
Сбер
Сбер
Москва

ГрейдJunior
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано1 дн назад
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Java разработчик (Кликстрим)ПАО Сбербанкдо 340 000 ₽FullStack-аналитикПАО СбербанкNLP/LLM ResearcherПАО СбербанкProduct Owner (analytics platform)ПАО Сбербанк
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).