Наши требования
Опыт работы в роли SRE/Reliability Engineer
Практический опыт расследования инцидентов в продакшене и проведения анализа первопричин
Глубокое понимание принципов мониторинга, алертинга и наблюдаемости
Опыт работы с метриками, логами и системами распределённой трассировки
Знание концепций SLA, SLI, SLO и бюджетов ошибок
Опыт создания и поддержки операционной документации и runbook’ов
Сильные аналитические навыки и умение доводить расследования до конкретных практических результатов
Понимание принципов работы распределённых и высоконагруженных систем
Опыт автоматизации операционных и повторяющихся задач
Сертификация CKA (Certified Kubernetes Administrator) и/или CKAD (Certified Kubernetes Application Developer)
Опыт работы с Prometheus, Grafana, OpenTelemetry или аналогичными платформами наблюдаемости
Опыт внедрения практик надёжности в инженерных организациях
Опыт работы с процессами управления инцидентами и проблемами
Понимание концепции Google Four Golden Signals