🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

ML‑инженер в команду данных отдела мультимодальной генерации

Яндекс
Москва, Белград
Гибридный, Офис
Опубликовано: 13 Dec 2025
Отдел мультимодальной генерации развивает модели семейства Alice AI: ART, VLM, системы синтеза речи. Их качество напрямую зависит от масштабных корпусов изображений, текстов, аудио и мультимодальных документов — у нас сотни миллионов семплов и десятки петабайт данных.

Какие задачи вас ждут

Майнинг данных
Мы строим дата‑пайплайны для сбора, обработки и фильтрации мультимодальных корпусов: видео и изображений, аудио и речи, текстовых описаний и транскрипций. Вам предстоит работать с разнородными источниками данных, прицельно находить релевантные домены и срезы под конкретный продукт: ART, image editing, VLM.

Оценка качества данных
Вы будете дорабатывать и применять ML‑модели для скоринга качества и релевантности, расчёта автометрик, тегирования и дедупликации добываемых данных. В том числе — использовать SOTA VLM для: автоматического описания изображений и видео (captioning) с выдачей подробных JSON‑характеристик сцены, стиля, содержимого; оценки качества и полезности пар «изображение — текст» для задач captioning и image editing; построения правил и эвристик для фильтрации низкокачественных и нерелевантных данных. Результатом вашей работы должны стать чистые, хорошо размеченные датасеты, которые сделают наши генеративные модели лучшими в мире.

Работа с хранилищем данных
Вы будете развивать слой доступа к данным для ML‑команд: проектировать схемы хранения и индексации, объединять разнородные источники (S3, аналог HDFS и другие) в единый каталог или реестр, настраивать удобные интерфейсы выборки и обработки десятков петабайт видео, аудио, изображений и текстов.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждем, что вы

  • Уверенно пишете на Python
  • Понимаете, как работать с большими объёмами данных, строили пайплайны сбора и обработки данных для ML
  • Знаете, как устроен процесс обучения моделей, и умеете использовать готовые фреймворки и архитектуры для задач качества данных
  • Нацелены на результат и готовы глубоко погружаться в область мультимодальных генеративных моделей
  • Следите за развитием машинного обучения и читаете статьи с топовых конференций
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие