Чем предстоит заниматься
Оценка качества агентных сценариев
Вы будете разрабатывать замеры, которые покажут, насколько качественно модели справляются с реальными пользовательскими запросами при сложной генерации и редактировании картинок в Алисе. Фокус — на агентских сценариях: цепочки рассуждений, веб-поиск, VLM-feedback loop
Создание пайплайнов генерации данных для агентных сценариев
Вам предстоит разрабатывать масштабируемые пайплайны создания обучающих данных для агентских сценариев: генерация траекторий рассуждений и вызовов дополнительных инструментов, разметка через judge-модели, фильтрация по качеству и сложности. Также вы станете вместе с ML-командой проводить эксперименты, чтобы наращивать качество модели, и анализировать их результаты
Аналитика и улучшение обучающих датасетов для генеративных моделей
Вместе с командой подготовки данных вам предстоит искать точки роста в датасетах, определять метрики качества самих данных и анализировать их влияние на качество генераций в экспериментах. Кроме того, вы будете создавать новые датасеты с нуля: проектировать сбор, запускать разметку и контролировать итоговое качество
Больше об аналитике в Яндексе — в канале Yandex for Analytics