Чем предстоит заниматься
Развитие рассуждающей модели
Ваша главная задача — учить одну из самых сильных рассуждающих моделей. Возможные задачи: сбор и поддержка пайплайнов генерации сред для RL для новых способностей Алисы; стабилизация RL-обучения нашей рассуждающей модели на масштабе траекторий, состоящих из сотен вызовов тулов; разбор ситуаций, где, как и почему модель ошибается на тяжёлых фактовых запросах, и перевод этого в успешный сигнал для обучения
Обучение моделей и анализ экспериментов
Вам предстоит работать в RnD-цикле экспериментов над элайнментом рассуждающих моделей — от формирования гипотез до анализа результатов и выбора дальнейших шагов. Вам также нужно будет взаимодействовать с аналитиками для построения стабильных замеров и искать точки роста инфраструктуры — с общей целью обучения лучшей возможной модели
Поиск новых направлений
Исследования LLM — очень бурно развивающаяся область с постоянно появляющимися моделями, статьями и даже направлениями. В нашей работе важно уметь выделять хорошо масштабирующиеся подходы, которые помогут достичь наших целей. Вы будете экспериментировать с самыми перспективными и свежими идеями
Больше об ML в Яндексе — в канале Yandex for ML