Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)
Описание
2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей. Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой. Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами. Чем предстоит заниматься Развивать Incident & Problem Management внедрять и развивать единый процесс управления инцидентами; формировать культуру postmortem-разборов без поиска виноватых; контролировать выполнение action items, направленных на предотвращение повторных сбоев; улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования. Развивать observability стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов; участвовать в создании единой платформы мониторинга и визуализации; разрабатывать стандарты логирования; контролировать объём и качество данных, поступающих в системы телеметрии. Трансформировать подход к алертингу проводить аудит существующих алертов и снижать число ложных срабатываний; формировать единые принципы приоритизации алертов с учётом критичности сервисов; помогать командам настраивать полезные, своевременные и понятные уведомления. Внедрять SRE-практики и повышать зрелость команд участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP; помогать командам определять и внедрять SLO/SLA; создавать дашборды для контроля Error Budget; разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов; консультировать продуктовые команды по вопросам стабильности и надёжности. Автоматизировать процессы формировать требования к развитию платформы дежурств и интеллектуальной эскалации; внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков. Мы ожидаем, что ты Работаешь в SRE или DevOps от 3 лет. Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability. Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana. Работал с OpenTelemetry или аналогичными инструментами. Автоматизируешь процессы на Python, Go, Bash или другом языке. Понимаешь принципы работы on-call-ротаций и систем управления инцидентами. Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения. Знаком с CI/CD, Kubernetes и контейнеризацией. Будет плюсом, если ты Внедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании. Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности. Что предлагаем Возможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие. Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей. Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми. Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов. ИТ-акредитацию. Удаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).