Чем предстоит заниматься
Разрабатывать batch-пайплайны на Spark/PySpark под управлением Airflow
Готовить витрины и датасеты для обучения, скоринга и мониторинга моделей
Работать с HDFS: организовывать слои и партиционирование данных, контролировать хранение и квоты
Оптимизировать производительность и ресурсоёмкость Spark-задач
Проектировать загрузку и хранение данных в ClickHouse, оптимизировать запросы и структуру таблиц
Обеспечивать надёжность пайплайнов: DQ-проверки, мониторинг, алерты и разбор инцидентов