Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаSRE во внутреннее облако (RTC)
В нашем облаке развёрнуты как крупные потребители, например Поиск или MapReduce в лице YT, так и десятки тысяч микросервисов, например весь сервис Такси.
Мы не только позволяем настраивать и запускать сервисы, но и даём пользователю всё что нужно, чтобы эксплуатировать этот сервис: настраиваем балансировку, предоставляем мониторинг поднятых сервисов, собираем логи, поддерживаем интеграцию с CI/CD и не только. Мы стремимся сделать из облака единую тесно интегрированную платформу (PaaS), с помощью которой разработчики смогут удобно и качественно разрабатывать и эксплуатировать свои сервисы, используя как стандартные механизмы API и UI, так и подход Infrastructure as Code.
Под управлением внутреннего облака находятся более 120 тысяч серверов и более 50 тысяч приложений — суммарно около миллиона контейнеров, а также суперкомпьютеры, которые входят в мировые топ-100. Чтобы все они работали как положено, мы создаём, поддерживаем и используем множество сервисов и инструментов. При необходимости чиним opensource-компоненты и отправляем патчи в upstream. Стремимся применять лучшие практики SRE, минимизировать рутину и автоматизировать эксплуатацию.
В нашу команду ищем опытного инженера. Вы будете строить гибридные облака и обеспечивать безопасную эксплуатацию кластера.
Какие задачи вас ждут
Разворачивать и развивать bare-metal-кластеры KubernetesВам предстоит проектировать и внедрять решения для развёртывания и эксплуатации крупных bare-metal-кластеров Kubernetes в выделенных дата-центрах, исследовать и адаптировать инфраструктурные сервисы для работы в гибридных средах — как на физических серверах, так и в облаках. Предстоит участвовать в развёртывании критически важных систем в Kubernetes, например YT — платформы для распределённых вычислений, при этом обеспечивать высокую производительность и отказоустойчивость. Работать с low-level-компонентами: Container Runtime (Porto), CNI, CSI, node agents, системными демонами, а также с настройкой ядра Linux и аппаратной спецификой серверов, разрабатывать собственные инструменты и контроллеры для Kubernetes, автоматизировать рутинные операции.
Развивать и совершенствовать автоматизацию обновлений облака
Вы будете поддерживать и модернизировать hostmanager — ключевой сервис для управления жизненным циклом хостов в облаке, автоматизировать обновления ОС, ядра, системных компонентов и Kubernetes-нод с минимальным влиянием на работающие сервисы, разрабатывать механизмы безопасного канареечного развёртывания и отката обновлений, интегрировать лучшие практики CI/CD и Infrastructure as Code в процессы эксплуатации инфраструктуры.
Наблюдать и управлять парком из 100+ тысяч хостов
Нужно обеспечивать высокую доступность и производительность всей инфраструктуры, анализировать метрики, логи и события для выявления и предотвращения инцидентов, участвовать в проектировании систем мониторинга, алертинга и диагностики на уровне хостов и кластеров, работать с распределёнными системами, оптимизировать использование ресурсов и снижать время простоя.
Улучшать безопасность и изоляцию системных компонентов
Предстоит работать над изоляцией dom0 и других критических компонентов виртуализации и оркестрации, внедрять механизмы безопасной загрузки (secure boot), контроля целостности, изоляции окружения, анализировать уязвимости и участвовать в повышении уровня защищённости инфраструктуры на всех уровнях: от железа до оркестратора.
Строить гибридные облачные решения
Будете интегрировать внутреннее облако с публичными облаками для создания гибридных и мультиоблачных сценариев, обеспечивать единый опыт эксплуатации сервисов независимо от их физического размещения, поддерживать кросс-платформенные решения для развёртывания, масштабирования и мониторинга сервисов.
Больше о разработке в Яндексе — в канале Yandex for Developers
Мы ждем, что вы
- Пишете на Go или Python
- Знаете, как устроен K8s, администрировали bare-metal-инсталляции, писали свои контроллеры
- Использовали Terraform, писали свои провайдеры
- Понимаете, как устроены большие кластеры и как их обслуживать
- Работали с публичными облаками
Будет плюсом, если вы
- Умеете и любите разбираться в новых технологиях
- Пишете на C++ и хотите развиваться в системном программировании для Linux
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие