Наши требования
Отличный Python 3, опыт с PyTorch, bash, git, Docker, dvc
Глубокое понимание representation learning и multimodal learning
Опыт с vision, audio и video моделями
Понимание трансформеров, contrastive learning, joint embeddings
Умение быстро разбирать и воспроизводить идеи из научных статей
Опыт с VLA / Embodied AI / Robotics
Знание self-supervised и multimodal pretraining подходов
Опыт работы с streaming video/audio
Публикации, open-source вклад или исследовательский опыт