Высшее образование
Опыт работы: 5+ лет
Глубокое понимание жизненного цикла ML‑модели: от экспериментов до продакшн‑инференса и мониторинга
Уверенный Linux, сетевые основы, безопасность, работа с контейнерами и оркестраторами
Опыт построения CI/CD‑пайплайнов для сервисов и ML‑артефактов (Docker images, модели, данные)
Опыт с LLM/GenAI‑платформами: vLLM, TGI, Hugging Face, Triton/ONNX Runtime, оптимизация инференса
Опыт построения feature store, model registry, ML pipelines (Kubeflow, MLflow, Airflow, Argo Workflows)
Работа в гибридной инфраструктуре: on‑prem кластеры + публичные облака (T1 Cloud, VK Cloud, Yandex Cloud и др.)
Понимание cost‑optimization: FinOps для GPU/CPU, автобалансировка нагрузок
Языки: Python (утилиты, обвязка) / Bash
Контейнеризация и оркестрация: Docker, Docker Compose, Kubernetes (Helm, Operators), желательно Kubeflow
CI/CD: GitLab CI / GitHub Actions / Jenkins / Argo CD
Инфраструктура: Terraform / Ansible, конфигурация Linux‑серверов, Nginx, cert‑manager
Data/ML‑инфраструктура: Apache Kafka, Airflow/Argo Workflows, S3‑совместимые хранилища, MLflow/Weights&Biases
Мониторинг и логи: Prometheus, Grafana, Loki/ELK, Sentry, alertmanager
Проектирование и развёртывание инфраструктуры платформы ИИ (кластер Kubernetes, storage, сети, security) под LLM/ML‑нагрузки
Построение воспроизводимых ML‑пайплайнов: обучение, валидация, packaging модели, деплой в batch и real‑time режимах
Настройка мониторинга моделей: метрики качества, дрейф данных, latency/throughput, автоматический rollback и retraining‑триггеры
Совместная работа с DS/разработчиками и внедренцами: перевод экспериментальных ноутбуков в надёжные сервисы для внутренних и внешних клиентов
Специализированные программы