WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Техлид / старший ML-разработчик в команду качества Alice AI LLM
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Техлид / старший ML-разработчик в команду качества Alice AI LLM

Яндекс·21 авг.

Техлид / старший ML-разработчик в команду качества Alice AI LLM

🔄 ГибридMiddleПолная занятостьКорпорация
Зарплата не указана
Вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Weekend Offer ML 12-13 сентября Регистрация до 4 сентября.

О роли

Наша команда занимается улучшением генеративных моделей Alice AI LLM для пользователей Алисы. Сейчас наша главная цель — сделать LLM-модель Alice AI ещё более умной, человечной и полезной для многомиллионной аудитории пользователей чата с Alice AI. Мы хотим, чтобы модель не только правильно решала задачи, но и общалась естественно: понимала контекст и настроение человека, подстраивалась под его ст

Чем предстоит заниматься

Исследование подходов RL и борьба с reward hacking
Хороший ответ LLM обладает различными свойствами: полезностью, человечностью, фактологичностью, безопасностью, уместной структурой и другими. Для улучшения каждого из свойств мы используем методы RL, например GRPO, в основе которых лежат reward-модели, обученные оценивать отдельные аспекты ответа. При этом важно находить tradeoff-ы между аспектами и учитывать корреляцию и антикорреляцию разных reward-функций
Одна из самых интересных задач здесь — борьба с reward hacking. В ходе обучения модель может найти «дешёвую» стратегию повышения reward-а: злоупотреблять определённой структурой, повторять одни и те же обороты или использовать формулировки, которые нравятся reward-модели, но делают ответы менее естественными. Так возникают узнаваемые паттерны, из-за которых разные ответы начинают выглядеть одинаково. Отдельное направление нашей работы — дешаблонизация: поиск таких паттернов, создание диагностик и срезов, улучшение reward-моделей и методов обучения так, чтобы рост метрик действительно означал рост качества
Развитие человечности модели
Мы хотим, чтобы Alice AI была не просто системой, которая выдаёт правильный текст, а внимательным и естественным собеседником. Модель должна понимать, когда нужен короткий ответ, когда подробное объяснение, а когда — поддержка или участие. Здесь предстоит исследовать человечность как отдельный аспект качества и учить модель адаптироваться к собеседнику, не теряя полезности и точности
Персонализация
Мы учим модель работать с долгосрочными фактами о пользователе, чтобы общение с Alice AI становилось более личным и последовательным. Здесь есть несколько сложных задач: находить релевантные воспоминания в истории диалогов, использовать их только тогда, когда они действительно помогают ответу, и выбирать, какая информация достаточно важна для сохранения в долгосрочной памяти
При этом модель не должна запоминать случайный шум или навязчиво упоминать всё, что знает о человеке. Нужно находить баланс между персонализацией, естественностью и полезностью
Обучение на пользовательском сигнале (RLUF)
Ещё одно направление — RLUF, или Reinforcement Learning from User Feedback. Мы учимся улучшать модель непосредственно по сигналам от пользователей, например отметкам «Нравится» и «Не нравится». Такой сигнал максимально близок к реальному продуктовому качеству, но при этом он шумный и неоднородный: одна и та же оценка может отражать полезность, стиль, фактологическую ошибку или просто несовпадение с ожиданиями конкретного человека
Здесь предстоит исследовать, как очищать и интерпретировать пользовательский сигнал, превращать его в устойчивый обучающий reward и проверять, что модель становится действительно полезнее и человечнее, а не учится эксплуатировать поверхностные закономерности обратной связи
Модели с tool calling и reasoning
Мы разрабатываем рассуждающие модели, умеющие делать tool calling в ходе рассуждений. Учим их раскладывать сложную задачу на шаги, выбирать подходящий инструмент, корректно формировать вызовы, анализировать результаты и восстанавливаться после ошибок. Важно научить модель понимать, когда инструмент действительно нужен, а когда лучше ответить самостоятельно, и фокусироваться не просто на генерации убедительного текста, а на достижении результата, которого ожидает пользователь
Больше об ML в Яндексе — в канале Yandex for ML

Наши требования

Работали с NLP и LLM — понимаете, как устроены современные языковые модели
Имеете глубокий интерес к прикладным ML-исследованиям и страсть к созданию умных моделей
Работали с Reinforcement Learning (RL) — знаете, как заставить модели учиться на своих действиях
Работали с reward-моделями, LLM-агентами и tool calling

Технологии и навыки

Гибридный
удалённая работа
офис
Я
Яндекс

ГрейдMiddle
ЗанятостьПолная занятость
РегионРоссия
ФорматГибрид
ИсточникСкрыто
Опубликовано21 авг.
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик на Python в Финансы на ПоискеProДоступна только зарегистрированнымЛид в UX-редакциюЯндексРазработчик ML-сервисов в AI Core Platform (Yandex Cloud)ProДоступна только зарегистрированнымРазработчик в группу разработки ML-инфраструктуры YTЯндекс
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).