Разрабатывать и внедрять кастомные метрики оценки ответов агентов: точность, полнота, непротиворечивость (включая LLM-as-a-judge)
Проводить структурный анализ ошибок (error analysis): выявлять паттерны галлюцинаций, сбоев логики, деградации качества
Планировать и проводить A/B-эксперименты: сравнивать версии промптов, архитектур агентов и модели; интерпретировать результаты
Генерировать синтетические датасеты (диалоги, запросы, эталонные ответы) для тестирования и улучшения агентов
Искать слабые места в работе агентов, вырабатывать и обосновывать решения по их устранению
Формализовывать требования к качеству и передавать метрики в команду глобального мониторинга платформы
Готовить аналитические отчёты и презентовать команде выводы: не просто цифры, а конкретные рекомендации
Работать с ad-hoc запросами: оперативно доставать данные, проверять гипотезы, разбирать инциденты
Научить систему лучше запоминать и использовать факты о пользователе, чтобы подстраиваться под его особенности и контекст
Развивать платформу для агентов, которые действуют на опережение — сами инициируют полезные операции или предупреждают о важных событиях без явного запроса
Усиливать безопасность и отказоустойчивость системы
Совершенствовать архитектуру, чтобы компоненты и процессы координировались быстрее и точнее