WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Старший DL-разработчик в команду ризонинга
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Старший DL-разработчик в команду ризонинга

Яндекс·21 авг.

Старший DL-разработчик в команду ризонинга

🔄 ГибридMiddleПолная занятостьКорпорация
Зарплата не указана
Вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Наша команда работает над развитием ризонинга у генеративных моделей Alice AI LLM. Мы стремимся научить модели действовать, как человек: составлять план решения, проверять разные подходы и верифицировать ответ. Многомиллионная аудитория Алисы уже оценила пользу этой технологии при помощи режима «Рассуждать». В работе мы основательно подходим к инженерии данных на всех стадиях. Наша цель — не только научить модель решать сложные математические задачи, но и сделать её полезной для решения широкого круга проблем. Для этого мы используем самые последние наработки из области Reinforcement Learning

Чем предстоит заниматься

Создание новых наборов данных
Разнообразие вопросов к LLM растёт. Но модели, которые щелкают математику как орешки, могут плохо справляться с задачами из других областей. Чтобы повысить качество рассуждений и ответов, необходимы данные различных уровней сложности и тематик. Вы сможете задействовать свои профессиональные компетенции, создавая подобные наборы задач
Улучшение функций награды
В эффективном обучении модели навыкам ризонинга ключевую роль играет функция награды. Благодаря ей модель учится выбирать корректные стратегии — скажем, выстраивать более лаконичные цепочки рассуждений, не снижая качества ответа. Однако в задачах, где результат непросто верифицировать (в отличие от, например, программирования или математических расчётов), создание такой функции становится серьёзным испытанием. Вашей задачей будет разработка надёжной функции награды
Развитие процедуры обучения
Оптимальная конфигурация обучения рассуждающих моделей — открытый исследовательский вопрос. Существуют различные направления для экспериментов: on-policy- и off-policy-обучение, адаптивное управления энтропией модели, способы расчёта advantage. Также требует внимания выбор подходящего функционала для минимизации, например, для Dense- и MoE-архитектур. Вы будете проводить подобные исследования и находить лучшие настройки для достижения поставленных целей
Больше об ML в Яндексе — в канале Yandex for ML

Наши требования

Отлично знаете математику, классические алгоритмы и структуры данных
Умеете программировать на Python
Разбираетесь в Reinforcement Learning. Вас не пугают такие слова, как GAE, PPO, GRPO и другие версии policy optimization
Имеете практический опыт в распределённом обучении больших моделей на основе архитектуры Transformer
Понимаете, как устроена стадия alignment'а современных LLM
Обучали рассуждающие (reasoning) модели
Работали c инфраструктурой для RL-обучения: VERL, vLLM, SGLang, etc

Технологии и навыки

Гибридный
Я
Яндекс

ГрейдMiddle
ЗанятостьПолная занятость
РегионРоссия
ФорматГибрид
ИсточникСкрыто
Опубликовано21 авг.
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик бэкенда в команду корпоративных продуктов Яндекс Go для бизнесаЯндексСтарший ML-разработчик в команду МедтехаЯндексАрхитектор решений в Yandex CloudЯндексML-техлид в команду планирования робота-доставщикаЯндекс
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).