Команда занимается сбором качественных данных, которые принципиально важны для обучения передовых моделей ИИ.
Определять техническую стратегию и целевую архитектуру системы.
Проектировать системы, готовые к масштабированию от миллионов до миллиардов сущностей: горизонтальное масштабирование, шардирование, геораспределение.
Принимать ключевые технологические решения: выбор стека, стратегии хранения, архитектурные паттерны (event-driven, CQRS и др.).
Проектировать end-to-end пайплайны: URL discovery → fetch → parse → deduplicate → store → deliver.
Писать код самых сложных и критичных компонентов: планировщик обхода, URL-фронтир, дедупликация, проводить performance engineering: профилирование, нагрузочное тестирование, устранение bottleneck-ов.
Оптимизировать прокси-инфраструктуру и маршрутизацию трафика на глобальном уровне, исследовать и внедрять новые технологии: HTTP/3, QUIC, eBPF, io_uring для максимизации throughput, разрабатывать стратегии оптимизации стоимости инфраструктуры (FinOps).
Руководить командой из 3–6 инженеров: планирование, декомпозиция, приоритизация, формировать и поддерживать технические стандарты: Code Review, coding guidelines, архитектурные ADR, менторить разработчиков, проводить 1-1, помогать в профессиональном развитии, взаимодействовать с потребителями данных и смежными командами для планирования roadmap.
Коммерческий опыт разработки на Python от 7 лет, из них не менее 2 лет в роли техлида/тимлида.
Экспертиза в проектировании распределённых высоконагруженных систем (миллионы RPS, петабайты данных).
Глубокое понимание сетевого стека: TCP/UDP, HTTP/1.1/2/3, TLS, DNS, QUIC.
Практический опыт построения масштабных систем краулинга или аналогичных data-acquisition систем.
Экспертиза в асинхронном и параллельном программировании.
Опыт проектирования микросервисной и event-driven архитектуры.
Опыт работы с Kafka, Redis, PostgreSQL, ClickHouse (или их аналогами).
Уверенное владение Kubernetes, Docker, Terraform, CI/CD.
Опыт работы с облачными платформами.
Навыки глубокого troubleshooting: tcpdump, strace, perf, eBPF-инструменты.
Опыт управления командой: планирование, Code Review, менторинг, 1-1, найм.
Знание Go, Rust или C++ для написания высокопроизводительных компонентов.
Опыт работы в компаниях с масштабным краулингом (поисковые системы, data-aggregators).
Опыт работы с io_uring, eBPF, zero-copy networking.
Опыт построения геораспределённых систем.
Опыт применения ML для оптимизации crawl-стратегий (приоритизация, фильтрация, классификация), публичные выступления, статьи.
Крупнейшее DS&AI community — более 600 DS-специалистов банка.
Дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира.
Возможность быть соавтором НИРов и статей для международных конференций.
Возможность выбрать удобный формат работы: гибрид или офис.
Ежегодный пересмотр зарплаты, годовая премия.
Корпоративный спортзал и зоны отдыха.
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
Вознаграждение за рекомендацию друзей в команду Сбера.