Чем предстоит заниматься
Генерировать синтетические данные: математика, код, произвольная синтетика с сидами - документами из Web
Исследовать токенизацию и ее влияние на качество модели (возможно написание статей)
Решать задачи кластеризации миллиардов документов
Исследовать разные факторы, которыми обладают текстовые данные
Генерировать Vision данные для прокачки VLM
Разрабатывать новые алгоритмы парсинга HTML и исследовать его влияние на качество модели
Исследовать зависимости между pretrain данными и agentic capabilities итоговой модели
Разрабатывать стабильную инфраструктуру, которая будет поддерживать проведение сотен и тысяч экспериментов над данными