Чем предстоит заниматься
Строить и улучшать автоматические процессы разметки данных
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы
Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше?
Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг?
Больше об аналитике в Яндексе — в канале Yandex for Analytics