Формат работы: удалённо из любой точки мира либо из одного из европейских офисов. Компания нанимает специалистов, которые уже переехали из России/Беларуси.
Международный продуктовый IT-холдинг с командой 3000+ сотрудников и высоконагруженными проектами в сферах iGaming, FinTech и Crypto. Мы ищем Senior Site Reliability Engineer. Вы будете работать с высоконагруженной платформой в production-focused-роли, которая сочетает backend-разработку и операционную ответственность.
Это hands-on-позиция: основной фокус будет на диагностике реальных production-проблем, стабилизации систем и повышении их надежности, а не на изолированной разработке новых фич.
Исследовать и устранять production-проблемы в различных сервисах и интеграциях.
Проводить глубокую диагностику с использованием логов, трейсов, метрик и запросов к БД для определения root cause.
Оптимизировать производительность системы: PostgreSQL-запросы, кеширование, поведение сервисов под нагрузкой.
Работать непосредственно с Kubernetes-окружениями: deployments, конфигурации, масштабирование и troubleshooting.
Улучшать observability: метрики, логирование и tracing с использованием Grafana и ELK Stack.
Поддерживать интеграции между сервисами Sportsbook и внешними клиентскими платформами.
Настраивать и конфигурировать новые проекты и окружения, преимущественно связанные со Sportsbook.
Разрабатывать внутренние инструменты и автоматизацию на Go для сокращения ручной работы и операционной нагрузки.
Работать с Kafka и RabbitMQ и диагностировать связанные с ними проблемы.
Взаимодействовать с разработчиками, QA и DevOps для решения инцидентов и повышения стабильности системы.
Что важно для нас
Уверенный опыт работы с Go — способность читать и писать production-код.
Сильные навыки debugging: умение находить и отслеживать проблемы на уровне нескольких сервисов, логов и слоев данных.
Опыт работы с PostgreSQL: анализ запросов, индексация и performance tuning.
Практический опыт работы с Kubernetes: kubectl, deployments, конфигурации, troubleshooting.
Опыт или хорошее знакомство с инструментами observability: Grafana, Kibana/ELK, logs/metrics/tracing.
Опыт работы с Redis, включая кеширование и диагностику проблем.
Опыт работы с Kafka и/или RabbitMQ: consumers, lag, retries, failures.
Понимание поведения распределенных систем под нагрузкой: timeouts, retries, race conditions.
Готовность работать непосредственно с production-системами и заниматься устранением инцидентов.
Способность работать самостоятельно: взять проблему, провести расследование и довести ее до полного решения.
Опыт работы с высоконагруженными системами или системами реального времени.
Опыт работы со Sportsbook / betting-платформами.
Опыт разработки внутренних инструментов или автоматизации для engineering-команд.