Развертывание и конфигурация Open Source LLM (DeepSeek, Qwen и др.) на собственных мощностях
Настройка высокопроизводительных инференс-серверов (vLLM, TGI, TensorRT-LLM, llama.cpp)
Оптимизация использования GPU (память, батчинг, quantization) для достижения требуемой пропускной способности и задержек (latency)
Настройка систем observability для слоя инференса: сбор метрик (количество запросов, время генерации, использование VRAM, throughput, количество активных потоков/запросов)
Реализация health checks (ready/live probes) для инференс-серверов
Автоматизация оповещений (alerts) при деградации производительности или падении сервисов
Настраивать сквозную трассировку (trace_id) по всей цепочке сервисов: от пользовательского интерфейса до агентов и инфраструктуры
Развивать дашборды в Grafana для мониторинга агентов, инфраструктуры и ключевых компонентов платформы
Внедрять кастомные метрики для агентов (запросы, статус, P95, LLM-вызовы, токены) без изменения кода агентов
Обеспечивать корреляцию логов и трейсов для быстрого поиска инцидентов
Настраивать алерты: технические (Pod OOM, память, ошибки) и качественные (satisfaction rate, регрессии)
Работать с централизованным Prompt Hub для хранения и обновления промптов без деплоя
Автоматизировать интеграцию E2E-тестов с системой трассировки
Поднятие и конфигурация бэкенд-серверов для работы агентов (FastAPI, Node.js или других runtime)
Контейнеризация (Docker) и оркестрация (Kubernetes / Docker Compose) компонентов системы
Управление окружениями (dev/stage/prod) и CI/CD пайплайнами для доставки кода агентов и обновлений инфраструктуры
Разработка агентов в структурированном формате Markdown, следуя принципам Claude/Harness Engineering (явное описание инструментов, контекста, последовательности действий)
Создание системных промптов, определения инструментов (tools/functions) и четких границ поведения агента
Интеграция агентов с внешними API, базами данных и DevOps-инструментами (Kubernetes, AWS, CI/CD)
Разработка и поддержка пайплайнов CI/CD
Внедрение новых инструментов для автоматизации и мониторинга
Взаимодействие с командами разработки, тестирования и эксплуатации