S

Middle+ / Senior Data Engineer / ETL-разработчик

SpbDev
Москва
🏢 Офис
Senior
Полная занятость
Россия
Описание вакансии

Мы — аутсорсинговая IT-компания, специализирующаяся на Data Engineering, DevOps и поддержке сложных корпоративных систем. Работаем с крупными заказчиками из банковского сектора, телекома, ритейла, промышленности и других отраслей.

У нас регулярно приходят запросы на Data Engineer и ETL-разработчиков для долгосрочных проектов российских компаний, формируем пул специалистов, которых сможем оперативно подключать к подходящим проектам.

Чем предстоит заниматься
В зависимости от проекта задачи могут включать
проектирование, разработку и поддержку ETL/ELT-процессов;
создание и развитие корпоративных хранилищ данных, Data Lake и витрин данных;
разработку DAG и настройку оркестрации процессов;
написание сложных SQL-запросов и их оптимизацию;
разработку трансформаций и процедур на SQL, Python или PySpark;
проектирование моделей данных и потоков движения данных;
контроль качества, полноты и согласованности данных;
анализ и устранение ошибок;
оптимизацию производительности обработки больших объёмов данных;
подготовку технической документации и описание разработанных решений;
взаимодействие с аналитиками, архитекторами, разработчиками и представителями заказчика.

Основные требования

Коммерческий опыт работы Data Engineer, ETL-разработчиком или DWH-разработчиком от 4 лет;
Уверенное знание SQL;
Опыт разработки на Python;
Опыт разработки и поддержки ETL/ELT-пайплайнов;
Практический опыт работы с Apache Airflow или другим инструментом оркестрации;
Понимание принципов построения DWH, Data Lake и витрин данных;
Опыт работы с реляционными базами данных;
Опыт работы с большими объёмами данных;
Понимание принципов моделирования данных;
Опыт работы с Git;
Умение разбираться в существующем коде и чужих пайплайнах;
Самостоятельность, ответственность и готовность доводить задачи до результата;
Умение работать в распределённой команде.

Будет преимуществом

Не требуется знание всего перечисленного — конкретный стек зависит от проекта:

Apache Spark и PySpark;
Hadoop-экосистема: HDFS, YARN, Hive, Kafka, NiFi, Sqoop;
ClickHouse;
Greenplum;
PostgreSQL и PL/pgSQL;
MinIO или другие S3-совместимые хранилища;
dbt;
Apache Iceberg, Trino и современные Lakehouse-подходы;
Data Vault, Kimball, модели «звезда» и «снежинка»;
Azure Data Factory;
Azure, Yandex Cloud или другие облачные платформы;
инструменты Data Quality, например Great Expectations;
SAS Data Integration Studio или Informatica PowerCenter;
Kafka и потоковая обработка данных;
Docker и Kubernetes;
CI/CD;
Jira и Confluence;
опыт мониторинга и сопровождения продуктивных data-платформ;
опыт работы в банковской сфере, телекоме, ритейле или промышленности.

Что важно отразить в отклике

Пожалуйста, укажите
ваш основной стек;
опыт работы с SQL и Python;
какие ETL/ELT-пайплайны вы разрабатывали;
с какими DWH, Data Lake и Big Data-технологиями работали;
используемые базы данных и инструменты оркестрации;
объёмы данных и примерные нагрузки на последних проектах;
текущую загрузку и возможную дату подключения;
желаемую ставку;
гражданство и текущую страну нахождения.

Даже если вы не соответствуете всему дополнительному стеку, присылайте резюме. Мы подбираем проект с учётом вашей основной специализации и практического опыта.

Формат работы
Полностью удалённая работа;
Проекты российских корпоративных заказчиков;
Работа преимущественно по московскому времени;
Загрузка — как правило, full-time;
Продолжительность проектов — обычно от 6 месяцев с возможностью продления;
Оформление и формат сотрудничества обсуждаются индивидуально;
AI-помощник
ИсточникСкрыто
Опубликовано1 дн назад
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение — прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).