WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Pretrain Data LLM Researcher (GigaChat)
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Pretrain Data LLM Researcher (GigaChat)

Сбер·Москва (м. Кутузовская)·12 июня

Pretrain Data LLM Researcher (GigaChat)

🔄 ГибридLeadПолная занятость
Зарплата не указана
56
Есть о чём спросить
Навык востребован (Python), за такой навык на рынке платят больше. Но вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Описание вакансии

Данные — главный рычаг качества фронтирной модели. Станьте тем, кто его держит

GigaChat обучает одна из крупнейших ML-команд страны. Мы знаем то же, что знают OpenAI и Anthropic: качество следующей версии модели определяют претрейн-данные. Поэтому мы ищем не «инженера по датасетам», а исследователя, который будет владеть данными как рычагом роста модели — от стратегии сбора до измеримого прироста на бенчмарках.

Контур влияния короткий и прямой: ваша гипотеза → эксперимент → обучающий прогон → прирост метрик модели, которой пользуются миллионы людей.

Чем предстоит заниматься
Вести программу экспериментов с данными.
Планировать, запускать и анализировать ablation-эксперименты: сравнивать версии смеси данных, фильтров и порядка обучения при фиксированном вычислительном бюджете. Вы автор эксперимента, а не исполнитель.
Оптимизировать смесь и порядок использования данных.
Отвечать на главный вопрос претрейна: какие данные, в какой пропорции и в каком порядке должна видеть модель. Применять интуицию scaling laws к распределению токенов.
Измерять качество данных.
Превращать расплывчатые «хорошие данные» в конкретные измеримые сигналы: классификаторы для отбора документов, насыщенных рассуждениями, кодом и знаниями.
Курировать корпус на масштабе триллионов токенов.
Проводить точную и fuzzy-дедупликацию, фильтрацию, очистку от утечек бенчмарков, html2text.
Собирать данные для agentic-pretrain.
Проводить поиск, сбор и генерацию траекторий использования инструментов, многошаговых рассуждений и взаимодействия со средой — чтобы агентные способности закладывались в модель уже на этапе претрейна, а не только в пост-обучении.
Создавать рецепты подготовки синтетических данных.
Генерировать синтетику под дефицитные способности модели (длинный контекст, рассуждения, код) — с количественной проверкой через эксперименты.
Замыкать петлю: «данные → обучение → оценка».
Развивать контур бенчмарков и сетапов экспериментов для измерений, чтобы каждое изменение данных имело измеримый ответ.

Кого мы ищем

Нам нужны сильные исследователи, а не исполнители. Главное — умение самостоятельно задавать правильные вопросы, проектировать эксперименты и доводить гипотезы до измеримого результата.
Опыт именно с LLM не обязателен, если у вас сильная экспериментальная практика в любой области ML — компьютерное зрение, рекомендательные системы, классический ML, наука — специфике больших языковых моделей мы научим.
Сильные основы ML и статистики, культура контролируемого эксперимента: гипотеза → дизайн → измерение → вывод.
Уверенный Python и опыт обучения моделей на PyTorch или аналогах.
Самостоятельность в исследованиях: умение вести направление от вопроса до результата, а не ждать постановки задачи.
Понимание цикла обучения LLM хотя бы на уровне теории: токенизация, scaling laws, влияние состава данных на качество.
Знакомство с распределённой обработкой данных (Spark, Dask, Airflow, Kubernetes) и открытыми data-проектами (FineWeb, OLMo, Dolma) — как минимум представление о том, как это устроено.

Не обязательно закрывать все вышеперечисленные пункты. Если вы сильный экспериментатор и хотите дорасти до владения всем циклом данных фронтирной модели — давайте поговорим.

Что мы даём — и почему это редкость на рынке
Вычислительные ресурсы под ваши эксперименты.
Один из крупнейших GPU-кластеров в стране.
ablation-эксперименты — это обучающие прогоны, и вы сможете запускать их регулярно, а не «раз в квартал, если повезёт».
Претрейн с нуля, а не дообучение чужих весов.
Мы обучаем собственную модель с первого токена — это значит, что ваши решения по данным определяют фундамент модели, а не косметику поверх чужого претрейна. Сейчас мы учим модели размером 400–700B параметров, и у нас есть амбиции выйти на масштаб 1.5–2T.
Опенсорс и мировая планка. Мы выкладываем модели в открытый доступ, и наша цель — достичь мирового уровня среди опенсорс-моделей. Ваша работа будет видна всему сообществу и будет сравниваться с лучшими открытыми моделями мира.
Полная ориентация на результат.
Минимум бюрократии, максимум ответственности и свободы. Работу меряем не количеством задач, а приростом модели на бенчмарках при том же бюджете. Подтверждённая гипотеза попадает в обучение следующей модели.
Развитая инфраструктура.
Зрелый стек для работы с данными и экспериментами: S3, YTsaurus, Airflow, DataLens, GitLab CI, wandb.
Вы приходите не строить платформу с нуля, а исследовать — пайплайны, оркестрация, трекинг экспериментов и визуализация уже работают.

Технологии и навыки

Apache Airflow
AWS S3
CI
CI/CD
Computer Vision
Data
DataLens
Design
GitLab
Kubernetes
LLM
Machine Learning
ML
OpenAI
Python
Сбер
Сбер
Москва (м. Кутузовская)

ГрейдLead
ЗанятостьПолная занятость
РегионРоссия
ФорматГибрид
ИсточникСкрыто
Опубликовано12 июня
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Security EngineerFreedom Holding OperationsMiddle/Senior Python разработчикСБЕРAndroid-разработчикForteBankDevOps-инженерМАГНИТ, Розничная сеть
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).