Incident Commander (SRE / NOC Lead)
Описание
Ищем опытного Incident Commander — человека, который управляет самыми сложными авариями в нашей сети и сервисах. Это не роль «дежурного инженера». Это роль лидера, принимающего решения в условиях неопределённости и высокой цены ошибки. Что тебе предстоит: Управлять критическими инцидентами уровня P1/P2, выполняя роль Incident Commander по модели IC-DC-SMC и координируя работу кросс-функциональных команд. За 2–3 минуты оценивать severity, организовывать WAR Room, определять стратегию реагирования и приоритеты: stop the bleed → stabilization → RCA → root cause remediation. Координировать выполнение мероприятий по восстановлению сервисов, принимая совместно с инженерными командами решения об откате релизов, failover ЦОДа, переключении трафика, частичной деградации сервисов и других мерах по снижению влияния инцидента. Вести incident timeline (detection → response → mitigation → resolution) в Jira, PagerDuty, Opsgenie и обеспечивать регулярную коммуникацию со стейкхолдерами и бизнесом. Организовывать проведение blameless postmortem, выполнять RCA и контролировать реализацию action items. Развивать процессы Incident Management: совершенствовать runbooks, playbooks, процессы on-call-ротации, организовывать Game Days и chaos engineering, анализировать и улучшать показатели MTTD, MTTR, MTBF, SLI/SLO attainment. Обучать новых Incident Commander, проводить ретроспективы и внедрять лучшие практики управления инцидентами. Что для нас важно: Опыт управления критическими инцидентами (P1/P2) в высоконагруженной или распределенной ИТ-инфраструктуре. Уверенное понимание сетевых технологий (TCP/IP, BGP, MPLS, DNS, HTTP/S), архитектуры LTE/5G Core, принципов работы Linux и инженерных инструментов диагностики (strace, tcpdump, iostat, journalctl). Опыт работы с инструментами Observability: Prometheus, Grafana, Zabbix, ELK/OpenSearch, Jaeger/Zipkin. Понимание процессов CI/CD, стратегий релизов (Canary, Blue-Green), жизненного цикла Kubernetes Pods, Helm, а также принципов работы PostgreSQL (connection pool, replication lag), Redis и Kafka. Знание процессов ITIL/ITSM (Event → Incident → Problem → Change Management). Умение принимать решения в условиях высокой неопределенности, эффективно управлять несколькими потоками работ (debug, escalation, communications, stakeholders, timeline), выстраивать коммуникацию с бизнесом и техническими командами, демонстрировать leadership without authority и придерживаться blameless mindset. Будет преимуществом: Опыт работы в telecom или крупных распределенных сервисах (e-commerce, cloud provider, CDN). Практический опыт проведения Game Days, chaos engineering и fault injection (Gremlin, Chaos Mesh, Litmus). Знакомство с требованиями РКН, 152-ФЗ, СОРМ. Опыт подготовки RCA или postmortem, повлиявших на архитектуру сервиса и повышение его надежности. Что мы предлагаем: Реальная ответственность и влияние на надёжность сервисов миллионов абонентов Обучение: бюджеты на конференции, курсы, сертификации (CKA, AWS SAA, SRE Foundation) Современный стек: k8s, Terraform, GitOps, собственный observability platform Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+. Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж. Материальную помощь. Детские подарки. Доплату по листу нетрудоспособности Корпоративные скидки на товары и услуги от партнеров компании. Служебную сотовую связь. Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока. Удалёнка / гибрид / офис — на выбор.