3+ лет опыта в роли Data Engineer / ML Engineer / Data Platform Engineer
Продвинутый Python и SQL
Практический опыт с Airflow и Spark/PySpark в production
Опыт разработки и оптимизации batch или streaming/micro-batch пайплайнов для больших объемов данных: от 100 TB до PB+
Уверенное понимание принципов распределенного хранения данных и распределенных вычислений
Опыт анализа производительности Spark jobs: shuffle, skew, partitioning, memory, resource usage
Опыт построения или развития высоконагруженных платформ обработки данных
Умение проектировать Data LakeHouse / Data Management Platform
Опыт работы с Kubernetes и S3-compatible storage
Понимание Apache Iceberg и современных форматов данных: Parquet, partitioning, schema evolution, compaction
Опыт построения мониторинга, алертов и CI/CD для пайплайнов данных
Опыт работы с поисковыми движками: ElasticSearch, OpenSearch, Vespa
Опыт работы с Cassandra или другими distributed NoSQL-хранилищами
Опыт работы с Kafka или другими брокерами событий
Понимание задач vector search, embeddings, ANN/HNSW, hybrid search
Опыт работы с GPU-инференсом моделей, PyTorch
Опыт работы с облачными платформами: AWS, Yandex Cloud, SberCloud
Опыт с observability stack: Prometheus, Grafana