Чем предстоит заниматься
Перезапуск процессов по событиям в прошлом
Регулярные процессы не всегда работают успешно, иногда они могут ломаться и завершаться с ошибками или производить некорректные данные. Мониторинг позволяет найти проблему, но не помогает её исправить. Мы собираемся дать инструменты для исправления ошибок в данных и конфигурациях, а также для массового перезапуска пострадавших процессов
Горизонтальное масштабирование процессора очередей
Процессор очередей является узким местом, стоящим на критическом пути жизненного цикла запусков процессов. Текущая реализация процессора — это единый мастер, пропускающий через себя весь поток появляющихся запусков процессов. Такой подход имеет потолок пропускной способности, и чтобы выдерживать дальнейший рост нагрузки, мы хотим пересмотреть архитектуру процессора очередей и найти вариант, который можно будет горизонтально масштабировать без потери корректности приоритизации ожидающих запусков
Экспорт событий для аналитики
Аналитические задачи, связанные со статистикой запусков процессов, часто возникают и у нашей команды, и у наших пользователей. Чтобы упростить аналитику, мы хотим начать экспортировать во внешнюю систему (YTsaurus) записи о появлении событий, запуске процессов, создании и редактировании других сущностей в системе. Здесь важно, во-первых, обеспечить надёжность поставки данных и их согласованность (при том, что разные сущности системы имеют разный жизненный цикл), а во-вторых, изолировать экспорт данных от основного процессинга, чтобы не снижать его надёжность и доступность
Больше о бэкенде в Яндексе — в канале Yandex for Backend