Наши требования
Глубокое SQL (оконные функции, CTE, оптимизация планов запросов)
Опыт работы с Apache Spark (PySpark/Spark SQL), Hadoop/HDFS, партиционирование, распределённые вычисления
Опыт работы с scala/python
Понимание устройства хранилищ данных
Опыт работы с большими объёмами данных
Знание общих подходов к оптимизации
Навыки работы с git и linux bash
Промышленный опыт реализации ETL процессов
Общее понимание ИИ-архитектур и ML-алгоритмов