Чем предстоит заниматься
Развивать и сопровождать AI-агента для автоматического обнаружения, диагностики и устранения инцидентов в критичных системах
Проектировать слой наблюдаемости (метрики, логи, трейсинг) как фундамент для работы AI-агента. Настраивать умный алертинг, корреляцию и группировку событий
Разрабатывать и отлаживать tools и playbooks, которыми агент пользуется для диагностики и устранения проблем
Разбирать инциденты (postmortem) и ошибки агента (ложные срабатывания), на основе анализа повышать точность и полноту автоматического реагирования
Наполнять и структурировать базу знаний агента (историю инцидентов, документацию), внедрять RAG для улучшения качества автоматических решений
Работать с инфраструктурным стеком компании: k8s, Istio, Nginx, haproxy, Kafka, Ignite, PostgreSQL, Hashicorp Vault, Nexus, ELK
Поддерживать и оптимизировать CI/CD-конвейеры нескольких команд
Работать с R&D задачами различной сложности