Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаCSA в команду голосовых проектов Алисы
Yandex Crowd — это крупный инфраструктурный сервис Яндекса. Мы внедряем краудсорсинг для масштабирования бизнес-процессов, таких как разметка данных, модерация контента, полевые исследования, тестирование, и строим внутренние продуктовые функции: клиентский сервис, телемаркетинг, локализацию и документирование.
Мы запустили краудсорсинговую платформу Яндекс Задания, участвовали в запуске YandeхGPT, выходе Яндекс Поиска в Казахстан, обучении Алисы арабскому языку и даже шёпоту — и во многих других проектах Яндекса.
Мы ищем Crowd Solutions Architect (CSA) в команду голосовых разметок Алисы. Вы будете создавать, поддерживать и постоянно улучшать процессы, связанные с разметкой данных для развития технологий голосовой активации, распознавания (ASR) и синтеза речи (TTS). Ваша главная задача — реализовать качественную разметку данных с учётом специфики предметной области и продукта. Вы будете заниматься и технической реализацией, и менеджерскими задачами — в большинстве случаев распределение близко к 50:50.
Какие задачи вас ждут
Сбор требований с заказчиков и проектирование процессов разметки данныхВы будете работать с заказчиками — преимущественно с командами аналитиков и разработчиков Алисы, которым нужен поток качественных данных, чтобы обучать модели и проводить эксперименты. Ваша задача — понять их потребность, декомпозировать задачу, спроектировать процесс разметки и подготовить техническое решение. Это может быть как простая задача классификации, так и сложный пайплайн с несколькими этапами фильтрации данных, их разметки и валидации.
Разработка новых метрик и улучшение контроля качества
Качество данных — ключевой показатель успеха. Вы будете определять метрики, проводить эксперименты, строить дашборды и анализировать результаты. Например, оценивать скорость разметки, точность исполнителей, влияние изменений в инструкциях и обучении на итоговый результат. Для этого применять на практике Python, SQL и проводить визуализацию в BI-системе.
Реализация и поддержка ETL-процессов
Вы будете создавать и поддерживать пайплайны сбора, обработки и выгрузки данных. Задачи включают написание скриптов, настройку автоматизаций, интеграцию с внутренними системами и API. Вы будете следить за стабильностью процессов и оптимизировать их под рост объёмов и качества.
Взаимодействие со смежными командами и исполнителями
Вы будете организовывать совместную работу не только с представителями заказчика, но и с другими смежными командами, а также исполнителями разметки. Важно управлять ожиданиями, реалистично оценивать сроки, проводить встречи, доносить обратную связь.
Мы ждем, что вы
- Знакомы с Python, умеете писать скрипты для обработки и преобразования данных
- Умеете писать и применять SQL-запросы
- Строите наглядные графики, интерпретируете метрики и объясняете их простым языком
- Можете переключаться между разными задачами и направлениями работы
- Взаимодействовали с заказчиками, способны управлять ожиданиями, оценивать сроки, вести обсуждения задач и фиксировать результаты
- Готовы работать с быстро развивающимися сервисами при меняющихся требованиях
Будет плюсом, если вы
- Понимаете принципы машинного обучения
- Применяли математическую статистику в работе
- Строили дашборды, имеете опыт работы в любой из BI-систем (Yandex DataLens, Power BI, Apache Superset и другие)
- Настраивали процессы выгрузки данных из разных источников
- Знаете, что такое API, взаимодействовали с сервисами по API
- Настраивали и запускали проекты в Толоке, Яндекс Заданиях или на другой краудсорсинговой платформе
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие