SRE-инженер
Описание
Обязанности: Обеспечение надежности, доступности и производительности распределенных систем через внедрение метрик SLI/SLO/SLA; Проектирование, развертывание и поддержка облачной инфраструктуры и on premise решений; Автоматизация операционных процессов: деплоймент, масштабирование, резервное копирование и восстановление; Настройка и развитие систем мониторинга, логирования и алертинга (Prometheus, Grafana, ELK, Loki, Alerta); Управление инцидентами: участие в дежурствах, реагирование на сбои, проведение постмортемов и внедрение превентивных мер; Развитие и поддержка CI/CD-конвейеров с фокусом на безопасность и надежность доставки GitLab CI; Администрирование и оптимизация кластеров оркестрации контейнеров (Kubernetes) и связанных сервисов; Внедрение практик «инфраструктура как код» (Ansible и etc) для управления конфигурациями и окружениями; Коллаборация с разработкой для повышения отказоустойчивости приложений (хаос-инженерия, capacity planning); Обеспечение безопасности инфраструктуры: управление секретами (Vault), сетевыми политиками, аудит доступа и соответствием стандартам Требования: Высшее профессиональное (техническое) образование; Опыт работы в роли SRE/DevOps/системного инженера от 2 лет с фокусом на эксплуатацию распределенных систем; Глубокое понимание принципов проектирования отказоустойчивых систем и работы с метриками надежности (SLI/SLO); Практический опыт администрирования Kubernetes: настройка кластеров, operators, service mesh (Istio/Linkerd), управление ресурсами; Уверенное владение инструментами IaC: Ansible, Packer для управления инфраструктурой; Опыт работы с облачными платформами (AWS, GCP, Azure) будет плюсом; Навыки программирования/скриптинга для автоматизации (Go, Python или Bash) с пониманием асинхронных паттернов; Практический опыт настройки систем мониторинга и алертинга с фокусом на снижение шума и повышение actionable-метрик; Знание сетевых технологий (TCP/IP, DNS, HTTP/S, балансировщики) и умение проводить траблшутинг на всех уровнях стека; Понимание принципов безопасности: управление секретами, принцип минимальных привилегий, аудит и соответствие стандартам (ISO 27001, SOC 2); Опыт работы в командной среде с применением методологий ITIL/ITSM для управления инцидентами и изменениями; Условия: Работа в динамично развивающейся компании с известным именем Конкурентная заработная плата Ежегодная премия по результатам работы Работа по ТК РФ Соц. пакет (питание, ДМС, страхование жизни) Гибридный график работы