SRE / Site Reliability Engineer

Солар
Москва
🏢 Офис
Senior
Полная занятость
Россия
Описание вакансии

Мы ищем SRE-инженера, который выведет наблюдаемость (Observability) наших продуктов на новый уровень. Ты не будешь просто "сидеть в мониторинге". Твоя задача вскрывать корневые причины самых сложных падений, автоматизировать диагностику и делать так, чтобы клиенты перестали замечать наши апдейты и сбои.

Обязанности
In-depth RCA (Root Cause Analysis): Анализ дампов памяти, тред-дампов, PCAP-трафика и логов на промышленных контурах заказчиков для выявления скрытых дефектов (Deadlock-и, утечки памяти, проблемы с TLS-инспекцией);
Управление инцидентами: Участие в ротации P1/P2-инцидентов. Быстрая диагностика (MTTR) и организация Blameless Post-Mortem;
Автоматизация SRE: Разработка на Python/Go скриптов и ботов для автоматического сбора диагностической информации с продакшена без остановки сервиса;
Построение Observability: Проектирование SLI/SLO для наших продуктов, настройка продвинутых дашбордов в Grafana + Prometheus, создание корреляционных алертов (чтобы не было ложных срабатываний);
Работа с Runbooks: Написание четких инструкций (Playbook-ов) для первой линии поддержки, чтобы 80% типовых проблем решались без твоего участия;
Взаимодействие с командами разработки: Ты "голос продакшена". Ты будешь ставить задачи разработчикам на исправление критичных багов на основе своих расследований.
Требования
Уверенный опыт работы с Linux (Debian/Ubuntu/CentOS и специализированные дистрибутивы, включая РедОС, Astra Linux);
Понимание жизненного цикла инцидентов (ITIL) и умение писать качественные Post-Mortem отчеты;
Опыт коммерческой эксплуатации высоконагруженных распределенных систем (от 5000+ RPS);
Глубокое знание сетевых протоколов: TCP/IP, HTTP/HTTPS, DNS, TLS 1.2/1.3 (обязательно умение читать PCAP и анализировать SSL-handshake);
Опыт работы с Java (анализ тред-дампов, Heap Dump через MAT/JProfiler) и C/C++ (GDB, core dumps);
Владение Python на уровне написания автономных утилит (парсинг логов, API-клиенты к системам сбора данных);
Владение Ansible, Terraform;
Опыт работы с ELK Stack (или Splunk): сложные поисковые запросы, создание визуализаций;
Опыт построения мониторинга с нуля (Prometheus + Grafana).
Мы предлагаем
Официальное оформление в аккредитованную ИТ-компанию;
Конкурентный оклад, премии по результатам работы;
Сильная команда экспертов, которые всегда готовы помочь и поделиться знаниями;
Возможность работать над передовыми продуктами в сфере кибербезопасности;
Перспективы для профессионального и карьерного продвижения;
Корпоративные мероприятия, путешествия, спортивные активности онлайн и оффлайн (онлайн-марафоны, бег, йога, волейбол, лыжи, и др.);
Социальный пакет
ДМС со стоматологией в лучших клиниках России, возможность подключить родственников по корпоративным ценам;
Доплата больничных до 100% от оклада (28 дней в году), 10 оплачиваемых day-off на случай форс-мажора;
Возможность бесплатного обучения: внешние обучения, профильные конференции, а также наши внутренние курсы и электронная корпоративная библиотека с сотнями книг;
Скидки от компаний-партнеров: спорт, английский, психолог, интернет и многое другое;
Материальная помощь при важных событиях в жизни (заключение брака, рождение детей и другое);
Удаленный формат работы в пределах РФ, либо современный офис рядом с м.Охотный ряд/Савёловская;
График работы: 5/2 с 9:00 до 17:30, либо с 10:00 до 18:30.
Технологии и навыки
AI-помощник
ИсточникСкрыто
Опубликовано10 июл.
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение — прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).