Чем предстоит заниматься
Развивать претрейн моделей
Исследовать архитектурные решения, рецепты и режимы обучения для VLM. Находить подходы, которые улучшают базовые способности модели, усиливают связь между визуальной и текстовой модальностями и дают устойчивый прирост качества
Работать с петабайтами мультимодальных данных: image-text, OCR, документы, таблицы, графики, интерфейсы, видео, UGC. Надо принимать решения, какие форматы и пропорции усиливают модель, исследовать scaling laws, превращать работу с данными в масштабируемый pipeline
Работать с large-scale-обучением. Профилировать узкие места, следить за эффективностью использования GPU, улучшать стабильность запусков и воспроизводимость экспериментов