Разрабатывать и улучшать методы online-RL
Реализовывать и дорабатывать подходы post-training и online-RL
Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
Строить и развивать инфраструктуру обучения
Разрабатывать и поддерживать пайплайны online-RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
Работать с данными и системой оценки качества
Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
Брать на себя ответственность за целые куски системы: от идеи до результата в проде
Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества