Чем предстоит заниматься
Разрабатывать и внедрять кастомные метрики оценки ответов агентов: точность, полнота, непротиворечивость (включая LLM-as-a-judge)
Проводить структурный анализ ошибок (error analysis): выявлять паттерны галлюцинаций, сбоев логики, деградации качества
Планировать и проводить A/B-эксперименты: сравнивать версии промптов, архитектур агентов и модели; интерпретировать результаты
Генерировать синтетические датасеты (диалоги, запросы, эталонные ответы) для тестирования и улучшения агентов
Искать слабые места в работе агентов, вырабатывать и обосновывать решения по их устранению
Формализовывать требования к качеству и передавать метрики в команду глобального мониторинга платформы
Готовить аналитические отчёты и презентовать команде выводы: не просто цифры, а конкретные рекомендации
Работать с ad-hoc запросами: оперативно доставать данные, проверять гипотезы, разбирать инциденты