Senior SRE
Описание
Мы создаём цифровой финансовый продукт, который меняет подход к кредитованию: карту без процентов и годового обслуживания, полностью управляемую через мобильное приложение. Продукт работает в трёх регионах, обслуживает около 300 000 пользователей и выдерживает нагрузку более 500 RPS. Мы ищем Senior SRE, который возьмёт на себя ответственность за процессы Monitoring & Event Management и Availability & Capacity Management. В этой роли важно не просто реагировать на инциденты, а выстраивать системную надёжность: прогнозировать нагрузку, определять измеримые цели по доступности, развивать observability и превращать выводы из сбоев в устойчивые изменения. Ключевые зоны ответственности Availability & Capacity Management: доступность, производительность, прогнозирование нагрузки и достаточность ресурсов. Monitoring & Event Management: качество мониторинга, событий, алертов и процессов реакции. Observability: метрики, логи, трассировки, дашборды и диагностическая готовность систем. Reliability governance: SLI/SLO, анализ инцидентов, disaster recovery и системные улучшения. Чем предстоит заниматься Сформировать SLI/SLO для критичных пользовательских сценариев совместно с бизнесом и техническими командами и внедрить контроль их соблюдения. Развивать мониторинг на базе Grafana, Prometheus, Zabbix и CloudWatch; проектировать информативные дашборды, улучшать алерты и снижать шум событий. Развивать централизованные логи в CloudWatch Logs и распределённую трассировку: расширять применение OpenTelemetry и оценивать использование AWS X-Ray. Прогнозировать нагрузку и потребность в ресурсах, выявлять узкие места и формировать рекомендации по масштабированию. Участвовать в нагрузочных испытаниях вместе с отдельным специалистом и использовать результаты для Capacity Management. Подключаться к production-инцидентам как технический эксперт, при необходимости координировать восстановление и регулярно проводить RCA. Обеспечивать выполнение корректирующих действий по итогам RCA и превращать выводы из инцидентов в устойчивые изменения систем и процессов. Отвечать за disaster recovery: определять и согласовывать RTO/RPO, контролировать резервное копирование, проводить тесты восстановления и проверять сценарии отказа AWS-региона. Контролировать доступность внешних систем, самостоятельно взаимодействовать с поддержкой поставщиков, координировать устранение сбоев и контролировать выполнение SLA. Участвовать во внутренних аудитах, учитывать требования регуляторов и обеспечивать корректную работу с персональными данными. Что для нас важно Не менее трёх лет опыта в роли SRE, DevOps или Infrastructure Engineer и готовность работать на уровне Senior. Практический опыт построения и развития процессов Monitoring & Event Management, Availability & Capacity Management и observability. Опыт определения SLI/SLO и внедрения измеримых целей надёжности. Уверенная работа с AWS, Kubernetes и Terraform в production-среде. Практический опыт администрирования и настройки Grafana и Zabbix; понимание Prometheus и CloudWatch. Понимание метрик, логов и распределённой трассировки, а также умение выстраивать диагностику сложных сбоев. Глубокое понимание Linux, сетевых протоколов и принципов работы распределённых систем. Опыт incident response, RCA и контроля выполнения корректирующих действий. Способность создавать поддерживаемые инструменты автоматизации, скрипты и интеграции; конкретный язык программирования не принципиален. Практическое владение инструментами, в том числе AI, для написания и ревью кода, анализа логов и инцидентов, подготовки RCA, runbook и работы с инфраструктурой — с обязательной проверкой результатов перед применением в production. Свободный русский и английский не ниже B2: предстоит регулярно общаться с мексиканскими коллегами, партнёрами и вендорами. Будет плюсом Опыт эксплуатации multi-region инфраструктуры и подготовки сценариев регионального отказа. Опыт мониторинга мобильных приложений и внешних финансовых интеграций. Практический опыт внедрения OpenTelemetry или AWS X-Ray. Опыт работы в финтехе и понимание требований PCI DSS. Опыт взаимодействия с регуляторами и участия в технических аудитах.