WorkaemКарьерная платформа
  • Вакансии
  • Компании
  • Зарплаты
  • Офферы
  • Сервисы
  • Блог
  • Работодателям
Workaem

Карьерная платформа для IT-специалистов: вакансии напрямую с карьерных страниц 300+ компаний, из телеграм-каналов, с международных площадок и от работодателей напрямую. Разбор условий, детектор мёртвых вакансий, AI-инструменты для резюме. Базовые функции бесплатны.

Подпишись, присылаем лучшие вакансии недели
Или читай канал в телеграме
Соискателям
Все вакансииЗа границейУдалёнка в долларахКомпании с РУ основателямиЗарплатыОфферыВозможностиСоветыСоздать резюмеТренировка интервью
По технологиям
Вакансии PythonВакансии JavaScriptВакансии ReactВакансии JavaВакансии GoВакансии Docker
По профессиям
РазработкаДизайнQA / ТестированиеАналитикаProduct / Project ManagerМаркетинг
Работодателям
Разместить вакансиюТарифыБаза кандидатовСвязаться с нами
Кабинет
РегистрацияВойтиЛичный кабинетМои откликиСохранённыеУведомления
Компания
О проектеПредложенияКонтактыБлогКонфиденциальностьУсловия использования
© 2026 Workaem. Все права защищены.КонфиденциальностьУсловияОферта
Made by IT, for IT 💛
Аналитик-разработчик в команду оценки достоверности Алисы AI
ВердиктОписаниеИнструментыКомпанияПохожие
  1. Главная
  2. /
  3. Вакансии
  4. /
  5. Аналитик-разработчик в команду оценки достоверности Алисы AI

Яндекс·21 авг.

Аналитик-разработчик в команду оценки достоверности Алисы AI

🔄 ГибридMiddleПолная занятостьКорпорация
Зарплата не указана
Вилки нет, про деньги придётся договариваться с нуля.
Нажмите на сигнал, чтобы увидеть, на чём он основан

Наша компания

Наша основная задача — сделать с высоким качеством сервис разметки достоверности ответов LLM-моделей. На вход он получает диалог и ответы разных релиз-кандидатов, прода, конкурентов и т. д. (в целом всё что угодно), а на выходе выдаёт размеченные ошибками части ответа. Пример можно посмотреть в HTML.

Чем предстоит заниматься

Голденсеты и инструкция
Это ключевая область — можно сказать, сердце разметки
Развивать имеющегося агента: довести f1 агента на критах до уровня редактора, сделать прокачку дешёвой
Собрать набор агентов, которые с высокой полнотой и приемлемой точностью будут готовить разметку
Исполнители-люди
Классическая работа с асессорами и редакторами для роста качества разметки и достижения нужной производительности. С учётом текущих реалий тут также важно выстраивать пайплайны с LLM
Подготовка хинтов (чтобы помогать исполнителям улучшать качество разметки)
Оценка качества комментариев
Раздебаг проблем и обучение людей (найти проблему и срез людей, у которых она наблюдается)
Система оплаты и мотивации
Аналитические: строим рейтинг исполнителей (развиваем подход, например модель Брэдли — Терри или микротюнинг текущего алгоритма), придумываем, как оценивать сложность заданий, а позже — как подбирать под задание группу исполнителей
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Собирать эталоны и узкие бенчи (например, сложная корзинка) для оценки качества исполнителей и агентов
Валидировать инструкцию на противоречия и вносить в неё правки, обсуждать с редакторами правки и изменения
Размечать ответы для новых направлений. (Например, ответы с файлами на входе — как проверять в случае противоречий в файле и интернете? Как относиться к пропускам информации? А к креативу на фактических данных? — и т. д., всегда много вопросов.)
Отвечать за качество голденсета — то есть на вопрос «почему мы можем верить, что наш голденсет собран достаточно хорошо?»
Исполнители-агенты
Новое направление, много низко висящих фруктов. В нём находятся задачи, связанные с развитием нашего основного агента-фактчекера, и создание новых дополнительных пайплайнов с LLM (например, для сбора голденсетов)

Наши требования

Понимаете, почему важно всегда смотреть в данные
Уверенно пишете на Python и знаете алгоритмы
Знаете математическую статистику и проверяли гипотезы с её помощью
Интересуетесь продуктом, стремитесь понять, каким он должен быть и почему
Умеете общаться, ясно излагать мысли, понимать и учитывать мнение коллег, убеждать
Работали с табличными данными на SQL
Имели дело с крауд-проектами, например делали разметку в Толоке
Знаете основы машинного обучения

Дополнительно

Средний по заданиям f1-score (для каждого задания следим, насколько хорошо попали в красный или красный + жёлтый)
Accuracy вердиктов (у нас есть режим сравнения ответов SBS, где нам важно быть согласованными с эталоном)
Accuracy выставленных оценок ответов (каждый ответ оценивается по 5-балльной шкале, мы стремимся максимально точно попадать в эталон)
Есть три зоны ответственности: 1) голденсеты, бенчмарки и инструкция; 2) исполнители-агенты; 3) исполнители-люди (асессоры + редакторы)

Технологии и навыки

Гибридный
офис
Я
Яндекс

ГрейдMiddle
ЗанятостьПолная занятость
РегионРоссия
ФорматГибрид
ИсточникСкрыто
Опубликовано21 авг.
Все вакансии компании

AI-помощник

под эту вакансию
Войди, чтобы AI оценил твоё соответствие вакансии и написал сопроводительное письмо

Похожие вакансии

Лид в UX-редакциюЯндексРазработчик ML-сервисов в AI Core Platform (Yandex Cloud)ProДоступна только зарегистрированнымРазработчик в группу разработки ML-инфраструктуры YTЯндексПродакт-менеджер развития и монетизации ИИ-сценариев в B2BProДоступна только зарегистрированным
Мы против мошенников на площадке: если тебя просят заплатить, продиктовать код или установить непонятное приложение, прекращай общение и сразу пиши нам (чат с основателем или форма обратной связи).