Чем ты будешь заниматься
•разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, сервисы, базы данных;
•настраивать и оптимизировать инференс-сервисы и системы мониторинга;
•работать с облачными сервисами и управлять инфраструктурой через Terraform;
•автоматизировать деплоймент ML-сервисов и взаимодействовать с ML командой;
•поддерживать ClearML для управления эксперементами и автоматизации обучения и деплоя;
•оптимизировать CI/CD и развертывание моделей, улучшать инструменты для экспериментов и мониторинга;
•реализовать деплоймент сервисов через Helm чарты и ArgoCD.
Стек: Kubernetes, Helm, ArgoCD, Terraform
Мы ожидаем
•опыт работы в DevOps/SRE от 3 лет
•опыт работы с системами мониторинга и алертинга, создания дашбордов (Prometheus, Grafana, Loki)
•глубокое знание основ DevOps-практик и методов эффективной организации CI/CD-процессов
•опыт взаимодействия с распределенными системами, контейнерами
•высокий уровень владения Linux и сетевыми технологиями
•способность быстро находить правильные технические решения и брать ответственность за их реализацию
•хорошая ориентация в ИТ: сетях, работе с данными, протоколах интернета, RPC и другом