Инженер третьей линии технической поддержки (Sber AntiFraud Platform)
Описание
Мы поддерживаем высоконагруженную банковскую систему класса критичности Mission Critical+ (МС+). Это максимальный класс: система работает круглосуточно, и любой сбой сразу замечают клиенты банка. Третья линия — последний рубеж перед разработкой. К нам приходят инциденты, которые не решились ранее, а от нас уходят задачи, после которых эти инциденты не повторяются. Мы ищем инженера, которому мало просто потушить пожар: важно понять, почему он начался, и сделать так, чтобы он не случился снова.Обязанности Разбирать инциденты, эскалированные от бизнес пользователей, системы мониторинга и дежурной смены: не только сбои, но и деградацию производительности под нагрузкой. Находить причину по логам, метрикам, трассировкам и данным в БД. Вести управление критичными инцидентами (процесс управления инцидентами): собирать нужных людей, координировать работу, держать бизнес и смежные команды в курсе статуса (коммуникационный план). Для системы МС+ счёт идёт на минуты. Готовить справки по итогам инцидентов: хронология, влияние на клиентов и бизнес, первопричина, что уже сделано и что нужно сделать, чтобы инцидент не повторился. Находить дефекты в продуктиве и подтверждать их: шаги воспроизведения, логи, запросы, ожидаемое и фактическое поведение. Ставить задачи на исправление в разработку так, чтобы разработчику не пришлось ничего переспрашивать, и вести их до выката исправления. Искать закономерности и повторяющиеся причины в прошедших инцидентах. Предлагать и доводить до конца меры, которые снижают число инцидентов: исправления, изменения в процессах, автоматизацию. Описывать новые метрики и алерты, если инцидент показал, что мониторинг не заметил проблему или заметил её поздно. Разбирать метрики, которые срабатывают неверно (ложные срабатывания, пропуски, неверные пороги), и добиваться их исправления. Требования Опыт от 3 лет во второй или третьей линии поддержки, в эксплуатации или SRE. Опыт поддержки высоконагруженных систем, работающих круглосуточно. Уверенные знания Linux: логи, процессы, сеть, базовый bash. SQL на уровне, достаточном, чтобы самостоятельно найти и проверить данные в продуктивной БД. Опыт работы с системами логирования и мониторинга: ELK / OpenSearch, Grafana, Prometheus, Zabbix Понимание устройства распределённых систем: микросервисы, HTTP/REST, очереди Kafka / RabbitMQ, интеграции. Знание процессов управления инцидентами и проблемами (ITIL или аналог). Аккуратность в работе с продуктивными данными в рамках требований информационной безопасности. Умение ясно писать: справка по инциденту и задача в разработку — ваш основной рабочий результат. Спокойствие и собранность во время критичного инцидента. Будет плюсом Опыт работы в банке или финтехе, понимание банковских процессов: платежи, карты, расчёты. Опыт ведения крупных инцидентов и проведения разборов в формате blameless postmortem. Kubernetes, Docker. Умение читать код Java / Python настолько, чтобы найти место дефекта. Писать продуктовый код не требуется. Трассировка и APM: OpenTelemetry, Jaeger и аналоги. Понимание SLI/SLO и практик SRE. Скрипты автоматизации на Python или bash. Сертификат ITIL 3/4 Foundation. Условия Комфортный современный офис (ст.м.Кутузовская) ежегодный пересмотр зарплаты, годовая премия корпоративный спортзал и зоны отдыха более 400 образовательных программ СберУниверситета для профессионального и карьерного развития программа адаптации и помощь руководителя на старте расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров вознаграждение за рекомендацию друзей в команду Сбера.