🔥
Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаТехнический лидер SRE
Cloud.ru
•
Москва
•
Гибрид
•
Опубликовано: 28 Apr 2026
- Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI для всех сервисов;
- Участвовать в устранении инцидентов - в связке со смежными командами устранять сбои и предотвращать их повторение
- Участвовать в заполнении и разборе постмортемов
- Расследовать причины инцидентов (RCA);
- Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов;
- Развивать мониторинг и алертинг - разработка, обогащение, настройка метрик, логов, трейсов, алертов, дашбордов, ранбуков (и их регулярный анализ/рефакторинг)
- Автоматизировать рутинную работу
- Ревьюить и помогать дорабатывать DRP, участвовать в качестве координатора в DRT, поддерживать DRP в актуальном состоянии;
- участвовать в разработке и оптимизации процессов, используемых в работе
- Встраивать в процессы практики: observability by default, alerting as code, runbooks, SLO/SLA/SLI
- Помогать командам строить отказоустойчивые сервисы: autoscaling, failover, chaos engineering
- Обеспечивать внутреннюю экспертизу по стабильности, метрикам, инцидентам и error budgets
🚀
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие