🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

Инженер по эксплуатации ML-платформы

Яндекс
Не указано
Гибридный, Офис
Опубликовано: 05 Sep 2025
В Яндексе ежедневно запускаются десятки обучений нейросетей, использующие десятки хостов с сотнями GPU на основе облачной платформы запуска batch-задач и распределённого хранилища данных YTsaurus. Поверх этой платформы реализован набор инструментов удобного конфигурирования распределённых вычислений для обучения нейросетей. Они обеспечивают выделение облачных нод с GPU, доставку кода обучения и данных на эти ноды, отслеживание статуса и результата обучения.

Мы ищем человека, который готов погрузиться в нюансы реализации этих инструментов и на основе этих знаний будет помогать ML-инженерам эффективно использовать инфраструктуру для машинного обучения, а также решать проблемы, возникающие при запусках обучений нейросетей.

Какие задачи вас ждут

Решение технических проблем
Вас ждут сбор и анализ первичной диагностики проблем с обучением, поиск первопричин падения или медленной работы распределённых вычислений, анализ логов и показаний мониторингов.

Взаимодействие с командами разработки инструментов ML
Вам предстоит собирать и анализировать фичреквесты и багрепорты, возникающие в рамках использования инструментов ML, и обрабатывать их вместе с разработчиками продукта для улучшения качества инструментов.

Консультирование ML-инженеров, пополнение базы знаний
Вы будете помогать ML-инженерам эффективно запускать обучения, рассказывать об улучшениях инструментов ML и объяснять нюансы их работы коллегам.

Мы ждем, что вы

  • Администрировали и настраивали Unix-системы, имеете опыт работы в Linux-консоли на уровне администратора
  • Хорошо понимаете сетевой стек
  • Умеете писать скрипты автоматизации на Bash и Python
  • Работали с системами контейнеризации и оркестрации (Docker+Kuber)
  • Занимались траблшутингом и дебагом пользовательских проблем
  • Умеете понятно и структурированно объяснять сложные вещи

Будет плюсом, если вы

  • Работали с Ipv6-сетями
  • На базовом уровне понимаете распределённые вычисления (MapReduce)
  • Обладаете знаниями в области High Performance Computing, в частности MPI
  • Работали с Apache Hadoop / YTsaurus и с распределёнными хранилищами типа Lustre/BeeGFS.
  • Администрировали GPU-кластеры: знакомы с CUDA, InfiniBand, NCCL
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие