WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Senior Data Engineer for VLM Training Data (GigaChat Vision)
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Senior Data Engineer for VLM Training Data (GigaChat Vision)

Сбер·Москва·16 июля

Senior Data Engineer for VLM Training Data (GigaChat Vision)

🏢 ОфисSeniorПолная занятость
Зарплата не указана
Навык востребован (Python). Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Описание вакансии

Мы ищем Senior Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными датасетами, понимать потребности исследователей и ML-инженеров, строить пайплайны очистки, фильтрации, категоризации и генерации данных, а также обеспечивать воспроизводимый экспорт данных в формат для обучения моделей.

Обязанности
Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.
Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.
Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.
Отвечать за инфраструктуру хранения и подготовки данных, включая
импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data.
валидацию и контроль качества данных.
хранение и версионирование датасетов.
экспорт данных в форматы, пригодные для обучения моделей.
Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.
Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.
Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.
Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.
Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.
Требования
Сильный опыт в data engineering и построении production-grade data pipelines.
Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.
Опыт работы с большими объёмами данных и распределённой обработкой.
Практический опыт с объектными хранилищами, в частности S3 или аналогами.
Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.
Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.
Опыт работы с DVC, Git, Docker.
Опыт работы с PostgreSQL или другими реляционными базами данных.
Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready-формат.
Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.
Готовность работать на стыке engineering и ML research.
Будет плюсом
Опыт работы с мультимодальными данными: изображения, текст, image-text pairs, captions, OCR, metadata.
Понимание того, как устроены современные датасеты для обучения VLM / LMM / multimodal models.
Опыт построения пайплайнов для synthetic data generation.
Опыт реализации quality scoring, filtering, semantic deduplication, clustering или data attribution.
Опыт визуализации статистики по большим датасетам и построения внутренних аналитических дашбордов.
Опыт работы с Common Crawl, LAION-подобными датасетами, open-source vision-language datasets.
Базовое понимание ML training pipeline и того, как качество данных влияет на качество модели.
Условия
крупнейшее DS&AI community — более 600 DS-специалистов банка.
дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира.
возможность быть соавтором НИРов и статей для международных конференций.
возможность выбрать удобный формат работы: гибрид или офис.
ежегодный пересмотр зарплаты, годовая премия.
корпоративный спортзал и зоны отдыха.
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
ипотека выгоднее до 7% для каждого сотрудника.
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
вознаграждение за рекомендацию друзей в команду Сбера.

Технологии и навыки

PostgreSQL
Python
Git
Docker
Machine Learning
Market Research
Research
S3
Design
Сбер
Сбер
Москва

ГрейдSenior
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано16 июля
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик в команду геосервисов автономного транспортаЯндексQA Lead в команду AI-агентов (Python)2ГИСTech Lead Java (GigaChat)СБЕРPenetration Tester (Middle)KPMG
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).