Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаML‑разработчик в команду ядра детекции (Автономный транспорт)
Мы обрабатываем данные с камер, лидаров и радаров, разрабатываем нейросетевые алгоритмы и внедряем их в работу автомобиля.
Сейчас в нашем стеке восприятия много разных компонентов с похожей семантикой: Occupancy Grid, Height Grids, лидарная семантическая сегментация, отдельные компоненты для работы со статикой и динамикой. Каждому из них нужна своя разметка, настройка и свой бюджет latency. При этом все они по сути описывают одно и то же: что и где занимает пространство вокруг машины.
Мы считаем, что все эти компоненты можно объединить в единое представление: 3D Occupancy Grid. Нам нужен специалист, который возглавит эту работу — от создания исследовательского PoC до внедрения продакшен‑модели в автомобиль.
Важный момент: разработка ведётся на новой query‑based модели восприятия. Мы отказываемся от набора независимых компонентов над плотными признаковыми картами и переходим к единому трансформерному бэкбону. В нём разные задачи будут выражаться через обучаемые queries.
Это значит, что вам предстоит работать не с устаревшей архитектурой, а с системой, которая только формируется. Ваши решения по дизайну 3D OG в этой архитектуре во многом определят, как будет работать система восприятия автомобиля в ближайшие годы.
Какие задачи вас ждут
Анализ методов 3D Occupancy PredictionВы будете изучать современные методы прогнозирования occupancy в 3D: и на основе данных с камеры (camera-only), и с объединением данных камеры и лидара (camera-lidar fusion). Нужно оценить, насколько эти методы подходят для нашей сенсорной конфигурации и вычислительного бюджета, а также обосновать, какую архитектуру стоит выбрать.
Интеграция 3D OG
Нужно спроектировать работу occupancy в трансформерной модели: разобраться в устройстве voxel/occupancy queries, понять, как функционирует cross-attention с признаками камер и лидара, выяснить, как задача разделяет бэкбон с детекцией и другими головами, а также найти способы избежать негативного transfer между задачами.
Анализ пайплайна и работа с датасетом
Вы будете разбирать текущий пайплайн генерации псевдоразметки для статических и динамических объектов: поймёте, как он работает, какие у него ограничения и где есть возможности для развития. Также соберёте датасет карт занятости и создадите стабильный пайплайн, который позволит регулярно пополнять датасет.
Обучение модели
Вы будете реализовывать и обучать модель, которая предсказывает 3D OG. Нужно продумать, как оценивать её работу: использовать метрики precision, recall, F1, IoU (по классам и по дальностным зонам), проанализировать предсказания визуально, а также честно сравнить разные подходы между собой и с текущими решениями.
Унификация голов восприятия
Вы будете постепенно заменять разные типы голов — OG, AG, height grids, лидарную сегментацию — единым представлением в виде voxel grid. При этом важно сохранить качество работы в критичных сценариях.
Оптимизация latency
Вы будете оценивать и оптимизировать стоимость инференса в рамках текущего бюджета, работать с realtime‑ограничениями на целевом оборудовании и доводить модель до стабильной работы на автомобиле.
Улучшение детекции
Вы будете итеративно повышать качество детекции: работать с лоссами и семплированием, применять аугментации и self-/semi-supervised-подходы, использовать дистилляцию, анализировать ошибки и работать с длинным хвостом сценариев.
Alignment и устойчивость
Вы будете обеспечивать, чтобы модели хорошо работали в разной погоде и освещённости, на различных сенсорных конфигурациях и в новых географических зонах. Также вам предстоит разрабатывать алгоритмы, которые определят, при каких условиях можно эксплуатировать систему (например, учитывать погоду, состояние дороги и деградацию сенсоров).
Больше об ML в Яндексе — в канале Yandex for ML
Мы ждем, что вы
- Уверенно обучаете нейросетевые модели и владеете PyTorch (или TensorFlow) и фреймворками поверх
- Ориентируетесь в прикладном DL и компьютерном зрении: знаете теорию, но измеряете себя практическим результатом
- Понимаете, как устроены трансформеры и attention изнутри — не только умеете их запускать, но и можете осознанно менять архитектуру
- Умеете работать с 3D‑представлениями: BEV, voxel grids, проективная геометрия, калибровки, работа с облаками точек
- Способны самостоятельно вести исследовательскую задачу: от обзора литературы и постановки метрик до понятных выводов
- Понимаете особенности realtime‑ограничений и умеете думать о latency на этапе выбора архитектуры
- Стремитесь использовать и распространять универсальные, масштабируемые практики
- Читаете статьи с ML‑конференций и следите за развитием области
Будет плюсом, если вы
- Работали с query-based архитектурами восприятия: DETR-подобные детекторы, Deformable DETR, BEVFormer, StreamPETR, Mask2Former и аналоги
- Работали с occupancy prediction или BEV-перцепцией (LSS, BEVFusion, TPVFormer, SurroundOcc, VoxFormer, FB-OCC и т. п.)
- Работали с мультимодальными моделями (камера + лидар + радар) и sensor fusion
- Обучали multi-task-модели с общим бэкбоном и умеете балансировать задачи между собой
- Строили пайплайны автоматической разметки и псевдоразметки, работали с накоплением сцен и SLAM-выходами
- Имели дело с большими моделями (LLM, VLM, Foundation Models) в иных доменах
- Оптимизировали инференс под целевое железо: TensorRT, квантизация, sparse convolutions, оптимизация attention
- Выполняли задачи автономного транспорта
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие