WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Руководитель направления ML Pretrain Multimodal LLM
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Руководитель направления ML Pretrain Multimodal LLM

Сбер·Москва·2 дн назад

Руководитель направления ML Pretrain Multimodal LLM

500 000 – 1 000 000 ₽
≈ 5,8 тыс.–11,5 тыс. $
🏢 ОфисLeadПолная занятость
500 000 – 1 000 000 ₽≈ 5,8 тыс.–11,5 тыс. $
Навык востребован (Python).
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Мы развиваем GigaChat и ищем сильного руководителя направления ML-pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера. Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптацию attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat.

Чем предстоит заниматься

Развивать архитектуру моделей GigaChat
Определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели
Проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации и инициализации
Развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность
Работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно
Изучать и применять законы масштабирования
Проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения
Предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб
Определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей
Определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline-ами, а в каких — нет
Анализировать стабильность архитектурных решений
Разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention
Предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым
Обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн
Писать ключевой код и оставаться сильным исследователем
Самостоятельно писать и дорабатывать архитектурные компоненты и абляции
Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций
Читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру
Руководить сильной технической командой
Руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки
Помогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения
Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели

Наши требования

Отличное владение Python и PyTorch
Глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии
Глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE
Практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций
Способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн
Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов
Опыт руководства сильной технической командой и готовность лично писать важные части системы руками

Мы предлагаем

Возможность выбрать удобный формат работы: гибрид или офис
Ежегодный пересмотр зарплаты, годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Ипотека выгоднее до 7% для каждого сотрудника
Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
Вознаграждение за рекомендацию друзей в команду Сбера

Технологии и навыки

Python
PyTorch
Machine Learning
LLM
Design
Artificial Intelligence
ML
Сбер
Сбер
Москва

ГрейдLead
ЗанятостьПолная занятость
РегионРоссия
ФорматОфис
ИсточникСкрыто
Опубликовано2 дн назад
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Разработчик в команду геосервисов автономного транспортаЯндексQA Lead в команду AI-агентов (Python)2ГИСPenetration Tester (Middle)KPMGЛидер команды R&D в MLСБЕР
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).