Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаРазработчик инфраструктуры для RL и оценки качества ИИ-агентов Алисы (C++/Python)
Какие задачи вас ждут
Разработка системы оркестрации RL-окруженийВо время обучения и оценки качества ИИ-агенты взаимодействуют с виртуальными средами (RL-environments). Вам предстоит проектировать и развивать систему, которая управляет этими средами и отвечает за их доступность, стабильность, масштабирование и удобство использования для команд.
Развитие RL-инфраструктуры для обучения ИИ-агентов
Для обучения используется RL — передовой подход к обучению LLM, в процессе которого ИИ-агент учится, взаимодействуя с виртуальной средой. Вы будете улучшать сбор траекторий и метрик для обучения, повышать стабильность и эффективность пайплайнов обучения, помогать командам по всему Яндексу обучать и внедрять ИИ-агентов в Алису.
Развитие инфраструктуры оценки качества ИИ-агентов
Важнейшим фактором успеха для ИИ-агентов является их качество. Нужно будет проектировать и разрабатывать инфраструктуру для оценки надёжности, стабильности и безопасности ИИ-агентов: от прогонов на реальных пользовательских запросах до синтетических сценариев, сгенерированных с помощью LLM-технологий.
Больше о бэкенде в Яндексе — в канале Yandex for Backend
Мы ждем, что вы
- Не менее пяти лет занимались промышленной разработкой на Python или C++ (желательно обеими), отлично разбираетесь в алгоритмах и структурах данных
- Понимаете жизненный цикл ML: данные → обучение → эвалы → выкладка → мониторинг (без обязательного опыта обучения моделей)
- Работали с контейнерами и оркестраторами, CI/CD, сбором метрик, умеете расследовать и устранять инциденты
- Аккуратно пишете код, тесты, документацию интерфейсов
Будет плюсом, если вы
- Имеете продакшн-опыт с распределёнными сервисами: очереди, идемпотентность, ретраи, согласованность, backpressure
- Работали с RL-фреймворками (VERL/TRL/TorchForge), разрабатывали Gym-совместимые среды или собственные симуляторы
- Работали с фреймворками LLM-инференса: vLLM/SGLang/TensorRT-LLM
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие