От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде. Обязательно хотя бы один свой GPU-сервис, доведенный до продакшена
Уверенное владение Python и Linux. Знание Docker, Git, CI/CD и базовая работа с Kubernetes
Практический опыт запуска моделей на PyTorch под NVIDIA GPU
Опыт работы минимум с одним production-стеком для инференса (vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналоги)
Понимание того, как устроена память GPU, что такое mixed precision, батчинг, KV-кэш и параллелизм моделей
Умение замерять производительность, читать профилировщики (PyTorch Profiler, Nsight, DCGM) и находить баланс между скоростью, качеством ответов и стоимостью вывода
Базовое понимание распределенных систем: таймауты, повторы запросов, отказоустойчивость при падении узла и выкат без простоев
Умение писать CUDA/Triton kernels, работать с NCCL и быстрой связкой узлов (NVLink/InfiniBand, GPUDirect/RDMA)
Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом
Знакомство с KServe или Ray Serve; сбор метрик через Prometheus/Grafana, GPU Operator или DCGM Exporter
Навыки конвертации весов моделей, проведения quantization-aware evaluation и сравнения разных движков инференса
Базовый C++ или Go для написания быстрых компонентов control/data plane