WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
ML-разработчик в команду алайнмента Alice AI
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. ML-разработчик в команду алайнмента Alice AI

Яндекс·21 авг.

ML-разработчик в команду алайнмента Alice AI

🏢 ОфисMiddleПолная занятостьКорпорация
Зарплата не указана
Вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Мы занимаемся алайнментом Alice AI: учим модель вести диалог, рассуждать, следовать инструкциям и пользоваться поиском и другими инструментами. Ищем ML-разработчиков в команду алайнмента. Внутри команды есть три направления с общей целью — улучшать качество модели после базового обучения. Конкретное направление выбираем вместе с кандидатом с учётом его опыта и интересов.

О роли

Во всех направлениях работа строится как непрерывный цикл: мы формулируем гипотезы, проводим эксперименты, оцениваем изменения в поведении модели и используем выводы в следующей итерации.

Чем предстоит заниматься

RL-алгоритмы и устойчивость обучения
Направление занимается RL-методами для обучения LLM. Мы работаем над ростом качества, стабильностью обучения и инструментами, которые помогают понимать состояние модели во время эксперимента
Задачи могут быть связаны, например, с новыми способами использовать reward-сигнал, оценивать действия модели или регулировать её обновление. Интересные идеи из исследований проверяем на наших моделях, а работающие решения переносим в основной обучающий контур
Интеграция моделей и сборка релиза
Разные эксперименты развивают разные способности модели. Это направление отвечает за то, чтобы объединить изменения в одной версии и сохранить их вклад в итоговое качество
Мы исследуем способы объединения стадий обучения — например, единое обучение, последовательные стадии или On-Policy Distillation. В каждой итерации собираем модель-кандидата, проводим комплексную оценку и уточняем способ интеграции. В рамках направления также поддерживаем актуальный стенд для быстрых экспериментов и приёмки изменений
Системные промпты и управляемость модели
Системный промпт задаёт поведение модели: например, роль, стиль, формат ответа или порядок работы с инструментами. В этом направлении мы учим модель гибко следовать новым системным инструкциям, сохраняя точность, полезность и остальные важные свойства
Мы развиваем методы обучения, данные и оценку поведения модели. Для проверки качества используем, например, экспертную разметку, reward-модели и LLM-as-a-Judge. Отдельное внимание уделяем reasoning, tool calling и переносу качества на новые сценарии
Больше об ML в Яндексе — в канале Yandex for ML

Наши требования

Хорошо знаете классический ML и DL
Понимаете устройство современных LLM и методы их обучения
Умеете переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и метрики
Способны интерпретировать результаты и находить причины изменений качества
Интересуетесь моделями с reasoning и tool calling
Имеете опыт в одной из близких областей: online RL для LLM, многостадийное обучение, distillation, instruction following, reward modeling или оценка поведения языковых моделей

Технологии и навыки

Удалённая работа
офис
гибридный
Я
Яндекс

ГрейдMiddle
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано21 авг.
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Системный аналитик клиентского опыта в Яндекс 360ЯндексPython-разработчик в складские операции ЛавкиЯндексРазработчик на C++ в группу обработки и хранения ассортимента МаркетаЯндексСтарший Java-разработчик в B2B TravelЯндекс
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).