Анализ существующего программного стека заказчика: фреймворки, версии, зависимости, ограничения среды выполнения
Анализ спецификаций: типы операций (матричные умножения, свёртки, внимание), ширина шины памяти, кэш-иерархия, поддержка специализированных инструкций
Выявление «узких мест» архитектуры для конкретного типа моделей
Бенчмаркинг эталонных моделей на целевой платформе для установления базовых метрик производительности (задержка (latency), пропускная способность (throughput), энергоэффективность)
Совместная работа с заказчиком для определения целевых метрик
Адаптация архитектуры модели (совместно с Data Science team): Замена операций, неэффективных на целевой архитектуре, Рефакторинг графа вычислений для минимизации перемещений данных между уровнями памяти, адаптация под ограничения: максимальный размер батча, разрешённые типы данных
Проверка корректности измененных моделей: Сравнительный анализ точности до/после оптимизации (метрики: F1, mAP в зависимости от задачи), тестирование на краевых случаях и аномальных входных данных, Обеспечение воспроизводимости результатов в рамках допустимого отклонения на стороне заказчика
Встраивание в CI/CD и MLOps (совместно с инженерами заказчика)
Проведение технических тренингов по работе с оптимизированными моделями. подготовка презентаций и материалов для демонстрации результатов работы представителям заказчика
Руководство командой инженеров