DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Umbrella.moscow·2 дн назад

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

≈ 150 000 – 400 000 ₽наша приблизительная оценка по 14 вакансиям этой роли и грейда, у работодателя вилка не указана
🏢 ОфисSeniorПолная занятость
≈ 150 000 – 400 000 ₽наша приблизительная оценка
54
Есть о чём спросить
Навык востребован (DevOps), готовы вкладываться в обучение. Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Привет! Меня зовут Эля, я HR компании «Амбрелла». Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.

О роли

Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB. Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.

Чем предстоит заниматься

ClickHouse
Администрировать продуктивные и тестовые кластеры ClickHouse
Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц
Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой
Анализировать системные таблицы ClickHouse и состояние кластера
Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц
Планировать горизонтальное масштабирование ClickHouse-кластера
Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера
Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище
Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям
Настраивать и сопровождать ClickHouse Keeper / ZooKeeper
Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия
Разрабатывать и проверять backup/restore и disaster recovery
Настраивать мониторинг, алерты и дашборды по ClickHouse
Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты
Администрировать продуктивные и тестовые инсталляции MariaDB
Контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов
Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication
Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах
Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster
Настраивать, сопровождать и диагностировать Galera Cluster
Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски
Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий
Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO
Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети
Настраивать TLS/SSL для клиентских подключений и репликации
Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB
Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой
Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации
Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов
Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах
Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений
Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production
Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты
Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения

Наши требования

Инженерная аккуратность и понимание рисков production-среды
Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production
Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы
Клиентоориентированность и зрелая коммуникация
Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках
Способность лидировать технические встречи, фиксировать решения и следующие шаги
Готовность документировать решения и передавать знания команде
Практический опыт промышленной эксплуатации ClickHouse
Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family
Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой
Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes
Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений
Опыт настройки TLS/SSL для ClickHouse
Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде
Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels
Опыт настройки и диагностики репликации MariaDB
Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации
Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий
Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO
Опыт эксплуатации Linux-серверов
Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB
Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры
Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга
Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты
Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата
Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты
Опыт или уверенное понимание Galera Cluster
Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем
Опыт работы с большими объёмами данных: десятки или сотни ТБ
Опыт работы с ClickHouse Keeper или ZooKeeper
Опыт эксплуатации ClickHouse / MariaDB на bare metal
Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами
Опыт нагрузочного тестирования ClickHouse и MariaDB
Опыт построения процедур disaster recovery
Опыт подготовки архитектурных и эксплуатационных документов для заказчиков
Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями
Опыт проведения регламентных работ с минимальным downtime
Опыт аудита продуктивных инсталляций у заказчиков

Мы предлагаем

Постоянная занятость
Работа с продуктивной, тестовой и лабораторной инфраструктурой
Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика
Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных

ГрейдSenior
ЗанятостьПолная занятость
ФорматОфис
ИсточникСкрыто
Опубликовано2 дн назад

AI-помощник

под эту вакансию
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).