S
Middle+ / Senior Data Engineer / ETL-разработчик
SpbDev
Москва
🏢 Офис
Senior
Полная занятость
Россия
Описание вакансии
Мы — аутсорсинговая IT-компания, специализирующаяся на Data Engineering, DevOps и поддержке сложных корпоративных систем. Работаем с крупными заказчиками из банковского сектора, телекома, ритейла, промышленности и других отраслей.
У нас регулярно приходят запросы на Data Engineer и ETL-разработчиков для долгосрочных проектов российских компаний, формируем пул специалистов, которых сможем оперативно подключать к подходящим проектам.
Чем предстоит заниматься
В зависимости от проекта задачи могут включать
•проектирование, разработку и поддержку ETL/ELT-процессов;
•создание и развитие корпоративных хранилищ данных, Data Lake и витрин данных;
•разработку DAG и настройку оркестрации процессов;
•написание сложных SQL-запросов и их оптимизацию;
•разработку трансформаций и процедур на SQL, Python или PySpark;
•проектирование моделей данных и потоков движения данных;
•контроль качества, полноты и согласованности данных;
•анализ и устранение ошибок;
•оптимизацию производительности обработки больших объёмов данных;
•подготовку технической документации и описание разработанных решений;
•взаимодействие с аналитиками, архитекторами, разработчиками и представителями заказчика.
Основные требования
•Коммерческий опыт работы Data Engineer, ETL-разработчиком или DWH-разработчиком от 4 лет;
•Уверенное знание SQL;
•Опыт разработки на Python;
•Опыт разработки и поддержки ETL/ELT-пайплайнов;
•Практический опыт работы с Apache Airflow или другим инструментом оркестрации;
•Понимание принципов построения DWH, Data Lake и витрин данных;
•Опыт работы с реляционными базами данных;
•Опыт работы с большими объёмами данных;
•Понимание принципов моделирования данных;
•Опыт работы с Git;
•Умение разбираться в существующем коде и чужих пайплайнах;
•Самостоятельность, ответственность и готовность доводить задачи до результата;
•Умение работать в распределённой команде.
Будет преимуществом
Не требуется знание всего перечисленного — конкретный стек зависит от проекта:
•Apache Spark и PySpark;
•Hadoop-экосистема: HDFS, YARN, Hive, Kafka, NiFi, Sqoop;
•ClickHouse;
•Greenplum;
•PostgreSQL и PL/pgSQL;
•MinIO или другие S3-совместимые хранилища;
•dbt;
•Apache Iceberg, Trino и современные Lakehouse-подходы;
•Data Vault, Kimball, модели «звезда» и «снежинка»;
•Azure Data Factory;
•Azure, Yandex Cloud или другие облачные платформы;
•инструменты Data Quality, например Great Expectations;
•SAS Data Integration Studio или Informatica PowerCenter;
•Kafka и потоковая обработка данных;
•Docker и Kubernetes;
•CI/CD;
•Jira и Confluence;
•опыт мониторинга и сопровождения продуктивных data-платформ;
•опыт работы в банковской сфере, телекоме, ритейле или промышленности.
Что важно отразить в отклике
Пожалуйста, укажите
•ваш основной стек;
•опыт работы с SQL и Python;
•какие ETL/ELT-пайплайны вы разрабатывали;
•с какими DWH, Data Lake и Big Data-технологиями работали;
•используемые базы данных и инструменты оркестрации;
•объёмы данных и примерные нагрузки на последних проектах;
•текущую загрузку и возможную дату подключения;
•желаемую ставку;
•гражданство и текущую страну нахождения.
Даже если вы не соответствуете всему дополнительному стеку, присылайте резюме. Мы подбираем проект с учётом вашей основной специализации и практического опыта.
Формат работы
•Полностью удалённая работа;
•Проекты российских корпоративных заказчиков;
•Работа преимущественно по московскому времени;
•Загрузка — как правило, full-time;
•Продолжительность проектов — обычно от 6 месяцев с возможностью продления;
•Оформление и формат сотрудничества обсуждаются индивидуально;