Чем предстоит заниматься
Построение целостной системы оценки качества ИИ-помощника: дерево метрик качества, целевые бенчмарки, side-by-side (SBS) сравнения с конкурирующими ассистентами, human evaluation и LLM-as-a-judge — с пониманием ограничений каждого метода и того, как они дополняют друг друга
Организация процесса дообучения моделей под продуктовые задачи: SFT, DPO и RL — от постановки задачи и подготовки датасетов (включая preference-данные из human feedback) до обучения, оценки и критериев допуска в прод; выстраивание воспроизводимого пайплайна, которым команда пользуется самостоятельно
Развитие эвал-платформы: замкнутый цикл «метрика → эвал → обучение/проверка → quality gate» как обязательный шаг допуска изменений модели и скиллов в продукт
Организация процессов человеческой оценки и разметки: экспертная и краудсорсинговая разметка, AI-тренеры, стандарты заданий, калибровка и контроль согласованности оценщиков
Руководство функцией через тимлидов трёх команд: ML/DS, продуктовая аналитика и AI-платформа (команды по ~5 человек); найм и развитие лидов, целеполагание, распределение приоритетов между продуктовыми доменами. Контроль функции продуктовой аналитики: единый слой продуктовых метрик, A/B на потоке, мониторинги ключевых метрик; квартальный и годовой roadmap аналитики, согласование стратегических развилок с владельцами продукта, платформы и данных
Представление решений аналитики на уровне C-level; развитие стандартов профессии и публичное представление команды — конференции, статьи