Сбер·Москва·5 дн назад
Руководитель направления AI Safety
Ориентир по рынку≈ 140 000 – 300 000 ₽наш грубый ориентир по 200 вакансиям этого грейда на рынке, без учёта специальности: у работодателя вилка не указана
🔄 ГибридMiddleПолная занятостьКорпорация
55
Есть о чём спросить
За такой навык на рынке платят больше, работа расписана подробно. Но вилки нет, про деньги придётся договариваться с нуля.
Чем предстоит заниматься
Обучать компактные и быстрые классификаторы входящих и исходящих сообщений: дистилляция, работа в жёстком бюджете latency, не деградируя качество основной модели
Развивать online-RL контур: дообучать защиты и модель на свежих атаках и сигналах с продакшена, сокращая цикл от обнаружения новой атаки до устойчивости к ней
Балансировать метрики защит: пропущенные нарушения против ложных срабатываний, и держать оба показателя под контролем на масштабе
Выстроить систематический red teaming: ручной и автоматизированный поиск джейлбрейков, prompt injection, обходов защит — перед каждым релизом и постоянно на живых моделях и продакшен-логах
Развивать GigaEmbeddings: подбор и синтез данных, contrastive learning, hard negatives, дистилляция в компактные версии — удерживая топ-1 на ruMTEB
Применять эмбеддеры в задачах безопасности: кластеризация атак и поиск аномалий в пользовательских логах, отслеживание эволюции техник обхода
Собирать из продакшен-данных датасеты, и целевые тестовые наборы под конкретные кейсы: например, рефразы или ранжирование
Быстро отвечать данными на вопрос «почему защиту пробили и что именно сломалось» и превращать разборы инцидентов в улучшения моделей
Наши требования
Отличное владение Python и PyTorch, практический опыт обучения моделей — классификаторов и LLM, а не только их использования
Опыт с RL-методами дообучения (RLHF/DPO/online-RL) или готовность быстро в них погрузиться на практическом уровне
Умение работать с продакшен-данными и обучать классификаторы: вытащить сигнал из логов, собрать датасет, посчитать метрики и понять, где разница значима, а где — шум.• Опыт обучения guard-моделей (Llama Guard и аналоги) или построения модерационных систем под высокой нагрузкой
Опыт обучения эмбеддеров или ретриверов и знакомство с бенчмарками MTEB/ruMTEB
Опыт автоматизированного red teaming и знакомство с профильной литературой по adversarial robustness
Опыт в командах безопасности разработчиков моделей; публикации или open-source вклад в области AI safety
Мы предлагаем
Возможность развивать GigaEmbeddings — лучший русскоязычный эмбеддер, больше года удерживающий топ-1 на ruMTEB
Команду сильных инженеров и исследователей
Возможность совмещать управление направлением с глубокой технической работой
Конкурентную компенсацию, премии и расширенный соцпакет
Дополнительно
Мы развиваем GigaChat — самый быстрорастущий AI-проект Сбера — и ищем сильного руководителя направления безопасности ИИ. Нашими моделями пользуются миллионы людей, и наша задача делать LLM безопасной — чтобы ее просто так нельзя было уболтать продать ваш Chevrolet за 1 рубль. А ещё, помимо безопасности, наша команда развивает GigaEmbeddings — эмбеддер, который больше года удерживает топ-1 по качеству среди русскоязычных моделей на лидерборде ruMTEB
Это роль для технического лидера, который возглавит направление: от обучения быстрых guard-моделей и online-RL до систематического редтиминга, аналитики атак на реальном трафике и развития лучших русскоязычных эмбеддеров