Мы в поиске Senior DevOps Engineer в команду ClickHouse DBA. Команда отвечает за развитие и поддержку платформы ClickHouse, обеспечивая ее надежность, отказоустойчивость и доступность для внутренних продуктов и сервисов компании.
Перед вами будут стоять задачи по развитию и сопровождению ClickHouse-платформы, автоматизации процессов, обеспечению надежности сервисов и развитию внутренних инструментов управления инфраструктурой данных.
Роль предполагает глубокую работу с инфраструктурой и автоматизацией, участие в принятии технических решений и развитие платформенных сервисов вокруг ClickHouse.
Команда: Team Lead, 2 DevOps-инженера
Стек: ClickHouse, ClickHouse Keeper, Linux, Ansible, GitLab CI/CD, Kubernetes, S3, Grafana, Prometheus, VictoriaMetrics, Python, Kafka, Hadoop.
Чем ты будешь заниматься
•Проектировать и развивать отказоустойчивые ClickHouse-кластеры с использованием шардирования и репликации
•Автоматизировать процессы развертывания, масштабирования и сопровождения инфраструктуры с помощью Ansible и Terraform
•Интегрировать платформу данных с внутренними сервисами и инфраструктурными решениями компании
•Развивать инструменты self-service для работы команд с аналитическими данными
•Настраивать мониторинг, алертинг и дашборды для обеспечения стабильности платформы
•Обеспечивать резервное копирование и восстановление данных с использованием S3-совместимых хранилищ
•Анализировать производительность платформы и обеспечивать выполнение SLA/SLO
Мы ожидаем
•Опыт работы в роли DevOps-инженера или инфраструктурного инженера от 5 лет
•Опыт эксплуатации ClickHouse в production-среде от 2 лет
•Глубокое понимание архитектуры ClickHouse, принципов шардирования, репликации и построения отказоустойчивых кластеров
•Уверенные знания Linux и опыт диагностики инфраструктурных проблем
•Практический опыт автоматизации инфраструктуры с использованием Ansible или Terraform
•Опыт работы с Kubernetes и контейнеризированными приложениями.
•Опыт построения и сопровождения CI/CD-пайплайнов
•Опыт настройки и сопровождения мониторинга, алертинга и систем сбора метрик.
•Знание принципов High Availability (HA) и Disaster Recovery (DR)
•Опыт работы с S3-совместимыми хранилищами, резервным копированием и восстановлением данных
•Навыки разработки на Python для автоматизации инфраструктурных процессов.
•Опыт интеграции инфраструктурных сервисов и работы с Vault, PKI или аналогичными решениями
•Понимание принципов построения OLAP-систем и аналитических платформ данных
Будет плюсом
•Опыт работы с Kafka и потоковой обработкой данных
•Наличие сертификаций по Kubernetes
•Участие в open-source проектах, связанных с ClickHouse или инфраструктурными технологиями