🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

Технический лидер SRE

Cloud.ru
Москва
Гибрид
Опубликовано: 28 Apr 2026
  • Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI для всех сервисов;
  • Участвовать в устранении инцидентов - в связке со смежными командами устранять сбои и предотвращать их повторение
  • Участвовать в заполнении и разборе постмортемов
  • Расследовать причины инцидентов (RCA);
  • Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов;
  • Развивать мониторинг и алертинг - разработка, обогащение, настройка метрик, логов, трейсов, алертов, дашбордов, ранбуков (и их регулярный анализ/рефакторинг)
  • Автоматизировать рутинную работу
  • Ревьюить и помогать дорабатывать DRP, участвовать в качестве координатора в DRT, поддерживать DRP в актуальном состоянии;
  • участвовать в разработке и оптимизации процессов, используемых в работе
  • Встраивать в процессы практики: observability by default, alerting as code, runbooks, SLO/SLA/SLI
  • Помогать командам строить отказоустойчивые сервисы: autoscaling, failover, chaos engineering
  • Обеспечивать внутреннюю экспертизу по стабильности, метрикам, инцидентам и error budgets
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие