Huawei Cloud Stack (MRS, GaussDB, OBS)
Kafka и CDC (Debezium)
Orac как источник
Dbt
Kubernetes
Spark
Prometheus и Grafana
Data Quality и Data Contracts
Подготовка данных для ML: обработка документов, векторные хранилища, эмбеддинги
3 + года в роли Data Engineer или близкой - ETL, DWH, backend с дата-уклоном
Уверенный SQL: оконные функции, планы выполнения, умение объяснить, почему запрос тормозит
PostgreSQL на практике - индексы, блокировки, партиционирование
Python на уровне промышленной разработки пайплайнов, а не разовых скриптов
Airflow или другой оркестратор - Dagster, Prefect, аналог
Опыт хотя бы с одной аналитической СУБД: ClickHouse, Greenplum, GaussDB(DWS), Vertica
Понимание распределённого хранения: HDFS, Hive-таблицы, движок вроде Spark. Конкретный дистрибутив не важен
Docker: собрать образ, разобраться, почему контейнер падает