Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаSRE Cloud Notification Service в Yandex Infrastructure
Наша команда работает над системой, которая поддерживает десятки миллионов одновременных WebSocket-соединений и обрабатывает экстремальные нагрузки. Мы создаём решения, позволяющие любым сервисам Яндекса быстро и надёжно взаимодействовать с пользователями через мобильные приложения, веб-интерфейсы и десктопные программы.
Роль SRE является одной из ключевых в развитии критически важного компонента инфраструктуры, от которого зависит работа десятков продуктов, используемых миллионами людей ежедневно.
Какие задачи вас ждут
Разработка Cloud Notification ServiceВам предстоит участвовать в создании нового сервиса нотификаций для Yandex Cloud на базе внутренней технологии. Сервис будет совместим с Amazon SNS, что откроет новые возможности для внешних разработчиков.
Непрерывная поставка
Вы будете разрабатывать и улучшать CI/CD-процессы, чтобы безопасно и быстро внедрять изменения в продакшен-окружение на Kubernetes-кластерах.
Надёжность и производительность сервиса
Вам нужно будет работать над архитектурой высоконагруженного сервиса с доступностью 99,99%. Задача — минимизировать задержки и потери при пиковых нагрузках, когда все соединения переподключаются одновременно.
Мы ждем, что вы
- Работали с PostgreSQL в высоконагруженных сценариях
- Автоматизировали процессы с помощью Python или Go
- Уверенно владеете Linux на уровне администрирования
- Понимаете принципы работы TCP/IP и умеете диагностировать сетевые проблемы
- Разбираетесь в построении распределённых и отказоустойчивых веб-сервисов
- Имеете опыт работы с системами мониторинга и управления конфигурациями
Будет плюсом, если вы
- Работали с Kubernetes и Helm
- Понимаете принципы работы очередей и распределённых систем
- Разбираетесь в обеспечении отказоустойчивости серверных приложений
- Имеете опыт разработки на Go, Python или C++
- Знакомы с процессами инцидент-менеджмента
- Умеете работать с Terraform для управления инфраструктурой
О команде
Наша команда — это группа инженеров, которые решают одни из самых сложных инфраструктурных задач в компании.Мы работаем с экстремальными нагрузками: большой шардированный кластер PostgreSQL из 22 шардов, десятки миллионов одновременных WebSocket-соединений, миллиарды отправок в день, нагрузки в API до 500K RPS.
Мы разрабатываем собственные эффективные решения, такие как уникальная реализация WebSocket-транспорта, которая экономит терабайты оперативной памяти, и FIFO-очередь на основе алгоритма Multi-Paxos для гарантированной доставки сообщений.
Наш стек включает Boost.Asio для асинхронных бэкендов на C++, Kubernetes для оркестрации и современные подходы к обеспечению надёжности.
В команде ценят глубокое погружение в технологии, свободу экспериментировать и ответственность за свои решения. Мы не боимся сложных вызовов — например, сейчас активно развиваем направление Cloud Notification Service, чтобы вывести наши наработки на внешний рынок.
Подписывайтесь на телеграм-канал Yandex Infrastructure, чтобы узнать больше о том, как мы делаем внутреннюю инфраструктуру Яндекса.
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие