Чем предстоит заниматься
Разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, inference-сервисы, прикладные сервисы и необходимые инфраструктурные компоненты
Проектировать, настраивать и оптимизировать инфраструктуру для ML/LLM inference, обеспечивать масштабирование, отказоустойчивость и эффективное использование вычислительных ресурсов
Автоматизировать развертывание ML-сервисов и моделей с использованием Helm, ArgoCD и CI/CD, развивать GitOps-подходы
Управлять инфраструктурой и облачными ресурсами через Terraform, разрабатывать и поддерживать Terraform-модули
Развивать мониторинг и observability ML-систем: метрики, логирование, алертинг, контроль доступности и производительности inference-сервисов
Совместно с ML- и backend-разработчиками улучшать процесс вывода решений из эксперимента в production и инструменты для разработки, тестирования и эксплуатации ML-систем