🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

Разработчик мультимодальных VLM (visual language models)

Яндекс
Москва, Белград
Гибридный, Офис
Опубликовано: 21 Aug 2025
Мультимодальные модели — один из трендов в области глубокого обучения. Мы, команда компьютерного зрения, строим визуально-текстовые мультимодальные модели (visual language models, VLM). Они адаптируют большие языковые модели для работы не только с текстом, но и с изображениями.

Мы ищем разработчиков, которые будут работать над нейросетями нового поколения и доводить свои решения до уровня готового продукта.

Какие задачи вас ждут

Обучение больших языковых моделей работе с визуальной информацией (изображениями и видео)
Вы будете работать на стыке двух областей: компьютерного зрения и обработки естественного языка. Для создания VLM используются нестандартные технические и архитектурные решения.

Создание больших дата-пайплайнов, которые обрабатывают все данные интернета
Для обучения VLM требуется очень много данных. Мы строим полноценные дата-пайплайны для сбора, обработки и фильтрации мультимодальных данных.

Оптимизация large-scale-обучения моделей и ускорение их инференса
В процессе обучения VLM много нюансов. Чтобы сделать его эффективным, приходится много профилировать узкие места. А после обучения нужно подумать про то, как сделать быстрый инференс таких моделей.

Адаптация моделей к продуктовым требованиям
Наша цель — внедрить VLM в каждый сервис Яндекса. Для этого приходится учитывать специфику каждой задачи, а главное — адаптировать модель (как архитектурно, так и функционально) к конкретным требованиям.

Мы ждем, что вы

  • Работали с большими объёмами данных
  • Обучали модели глубокого обучения и внедряли их в продакшн
  • Понимаете, как работают современные архитектуры нейронных сетей
  • Знакомы с большими языковыми моделями
  • Следите за последними достижениями в областях компьютерного зрения и обработки естественного языка (понимаете, чем ViT отличается от ConvNeXt)
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие