🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

Site Reliability Engineer

Звук
Москва
Гибрид
Опубликовано: 17 Jul 2026

О роли

Мы ищем того, кто готов решать сложные задачи, погружаться в детали, быть хранителем стабильности и надежности наших сервисов. Если ты считаешь, что совершенство — это не цель, а путь, готов предлагать новые решения и внедрять передовые технологии, мы будем рады видеть тебя в нашей команде.

Почему это важно

Наша главная цель — поддерживать такие условия, при которых пользователи могут наслаждаться стабильностью и надежностью наших сервисов, открывая для себя новые горизонты звука.


Чем предстоит заниматься:

  • Надежность и инциденты: Работа с инцидентом на всех этапах. Учавствовать в активных инцидентах в качестве координатора и/или инженера починки. Расследовать инциденты, проводить Post-mortem встречи с командами Dev/QA/OPS. Разрабатывать и актуализировать: планы восстановления, инструкции для дежурных, DRP. Проводить мероприятия на снижение MTTR, количество инцидентов. Участие в коммуникации с партнерами в рамках общих инцидентов;
  • SLA/SLO и Error Budget: Внедрять и контролировать метрики надежности SLI/SLO/SLA внутренние и внешние. Участвовать в приоритизации бэклога разработки на основе анализа Error Budget;
  • Observability (Наблюдаемость): Развивать системы мониторинга и трейсинга совместно с подразделением мониторинга (настраивать сбор метрик, дашборды в Grafana);
  • Инфраструктура и K8s: Администрировать Kubernetes кластеры (ресурсы, автоскейлинг). Управлять сервис-мешем (Istio): настраивать сетевые политики, traffic routing, rate limiting, circuit breakers. Управление конфигурацией location nginx;
  • Дежурства в рабочее время: контроль сетки релизов, реагирование на обращения коллег DEV по проблемам в межсервисном взаимодействии. Анализировать логи и трейсы в Jaeger/Tempo, Kibana/Loki;
  • Дежурства в НЕрабочее время: реагирование и подключение на инциденты во внерабочее время. На текущем этапе команда переходит от добровольной к плановой системе дежурств. Нужно быть готовым к дежурствам в праздничные дни и каникулы. Все часы дежурств и вызовов во внерабочее время оплачиваются дополнительно.

Успех в роли обеспечат:

  • Опыт в SRE / DevOps от 2-3 лет. Понимание идеологии SRE, опыт работы с SLI/SLO/SLA и Error Budget на практике. Опыт работы в production окружениях;
  • уверенное администрирование. Понимание того, как работают операторы, сетевые модели и механизмы отказоустойчивости на уровне Pod/Deployment;
  • опыт участия в дежурствах или роли Incident Commander. Умение не просто «тушить пожары», а системно устранять их первопричины;
  • опыт настройки алертинга, опыт написания инструкций и DRP;
  • уверенное написание скриптов и небольших сервисов/ботов на Go или Python и Bash.
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие