WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
MLOps / ML Infrastructure Engineer
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. MLOps / ML Infrastructure Engineer

X5 Tech·Россия·27 авг.

MLOps / ML Infrastructure Engineer

🌍 УдалённоSeniorПолная занятость
Зарплата не указана
60
Хорошие условия
Навык востребован (Python), за такой навык на рынке платят больше. Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Описание вакансии

Ищем инженера, который будет отвечать за стабильную работу ML-инфраструктуры и сервисов инференса в production.

В этой роли предстоит настраивать и поддерживать Triton Inference Server, работать с Kubernetes и CI/CD, следить за стабильностью ML-сервисов и пайплайнов, разбирать инциденты и постепенно улучшать инфраструктуру.

Чем предстоит заниматься
Настраивать и поддерживать NVIDIA Triton Inference Server для production-нагрузки.
Загружать и обновлять модели в Triton, настраивать model repository, версии моделей и параметры инференса.
Поддерживать и развивать CI/CD для моделей и ML-сервисов.
Настраивать Kubernetes-ресурсы: CPU, GPU, memory, requests/limits, autoscaling и Deployment-ы.
Поддерживать DAG-и и пайплайны, разбирать и устранять возникающие проблемы.
Диагностировать инциденты: миграция базы, проблемы с сервисами, нехватка памяти/CPU/GPU, падения Pod-ов и другие production-проблемы.
Следить за состоянием сервисов по дашбордам, метрикам и логам.
Анализировать логи и метрики: определять, что именно сломалось, когда началась проблема и где находится её первопричина.
Участвовать в устранении технического долга и развитии инфраструктуры.
Переводить существующие процессы на более современные инструменты, в том числе участвовать в миграции на MLflow.
Автоматизировать повторяющиеся операции и снижать количество ручных действий при эксплуатации ML-сервисов.

Что ожидаем

Уверенное знание Linux и понимание принципов эксплуатации production-сервисов.
Практический опыт работы с Kubernetes: Deployments, Pods, requests/limits, probes, ConfigMap/Secret, volumes, ресурсы и troubleshooting.
Опыт настройки и эксплуатации CI/CD.
Понимание принципов работы ML-инференса и жизненного цикла ML-модели в production.
Опыт работы с Triton Inference Server или близкими системами model serving.
Умение читать и анализировать логи и метрики, находить причину проблем, а не только перезапускать сервис.
Базовое понимание мониторинга: Prometheus/Grafana или аналогичные инструменты.
Опыт работы с Python и/или Bash для автоматизации.
Умение самостоятельно разбираться в незнакомой инфраструктуре и доводить проблему до решения.
Будет плюсом
Опыт работы с GPU в Kubernetes: NVIDIA device plugin, GPU requests/limits, CUDA.
Опыт оптимизации ML-инференса и понимание latency/throughput/batching.
Знание MLflow и практический опыт работы с Model Registry.
Опыт с Airflow или другими системами оркестрации DAG-ов.
Опыт работы с Prometheus, Grafana, Loki/ELK и системами алертинга.
Знание Helm, Terraform или Argo CD.
Опыт эксплуатации ML-платформ или большого количества ML-сервисов в production.

Технологии и навыки

Linux
Kubernetes
Triton Inference Server
Prometheus
Grafana
Python
Bash
X5 Tech
X5 Tech
Россия

ГрейдSenior
ЗанятостьПолная занятость
РегионРоссия
ФорматУдалённо
ИсточникСкрыто
Опубликовано27 авг.
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Penetration Tester (Middle)KPMGНачальник отдела администрирования автоматизированной системы взаимодействияБелорусский межбанковский расчетный центрМладший системный инженер (Ceph)Лаборатория КасперскогоРуководитель направления аналитики взысканияАк Барс Банк
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).