Все вакансии России 0

DevOps-инженер

з/п не указана
СДЭК
Екатеринбург Постоянная занятость Полный день

Описание

DevOps Engineer / SRE (Middle+ / Senior) Мы развиваем платформу складской логистики и интеграций с маркетплейсами, интернет-магазинами и внешними сервисами. Наши системы обрабатывают заказы, складские операции, статусы, этикетки и обмен данными между клиентами, маркетплейсами и WMS. Ищем DevOps-инженера, который возьмёт на себя развитие, безопасность и надёжность инфраструктуры. С чем предстоит работать Yandex Cloud; Managed Kubernetes; виртуальные машины Linux; GitLab CI/CD и Container Registry; PostgreSQL, MySQL, MongoDB; Kafka; Redis/Valkey; Object Storage; Yandex Lockbox; nginx и ingress-nginx; Grafana, Prometheus и Loki; VPN, security groups и внутренние облачные сети. В инфраструктуре работают интеграции с Wildberries, CDEK, Tilda, InSales, Dostavista, Metaship, Kaspi, Bitrix24, Диадок, WMS/WMS и другими внешними системами. Основные задачи Поддерживать и развивать инфраструктуру в Yandex Cloud. Администрировать Managed Kubernetes и виртуальные машины. Обеспечивать стабильную работу интеграционных сервисов, API и webhook. Развивать GitLab CI/CD: сборку, тестирование, доставку и откат приложений. Сопоставить Kubernetes workloads с GitLab-репозиториями, секретами и владельцами сервисов. Поддерживать nginx, ingress, балансировщики нагрузки, DNS и TLS-сертификаты. Настраивать безопасный административный доступ через VPN и OS Login. Проводить аудит IAM, сервисных аккаунтов, SSH-доступов и групп безопасности. Закрывать избыточные публичные порты и настраивать доступ по принципу минимальных привилегий. Поддерживать PostgreSQL, MySQL, MongoDB, Kafka и Redis/Valkey. Контролировать резервное копирование баз данных, виртуальных машин и Object Storage. Регулярно проверять восстановление из резервных копий. Развивать мониторинг и журналирование в Grafana, Prometheus и Loki. Настраивать технические и бизнес-алерты: ошибки webhook, необработанные заказы, задержки интеграций, Kafka lag, недоступность WMS и внешних API. Участвовать в разборе инцидентов и поиске причин ошибок интеграций. Подготавливать runbook, схемы взаимодействия, инструкции по восстановлению и эксплуатационную документацию. Контролировать использование облачных ресурсов и предлагать варианты оптимизации затрат. Первые задачи после выхода Провести инвентаризацию Kubernetes: namespaces, deployments, StatefulSets, CronJobs, Services, Ingresses и ConfigMaps. Составить карту «сервис → репозиторий → CI/CD → секреты → базы данных → внешние системы». Проверить публичные IP, открытые порты, security groups и временные SSH-доступы. Настроить полноценное резервное копирование критичных виртуальных машин. Проверить защищённость публичных Object Storage бакетов. Проверить TLS, аудит и журналирование Managed MySQL. Проверить отказоустойчивость Kubernetes и отдельных интеграционных VM. Разделить или дополнительно изолировать production и development workloads. Настроить мониторинг критичных потоков заказов и интеграций. Формализовать RPO, RTO и порядок действий при аварии. Обязательные требования Опыт работы DevOps/SRE-инженером от 3 лет. Уверенное администрирование Linux. Практический опыт работы с Kubernetes в production. Понимание Deployments, StatefulSets, Services, Ingress, ConfigMaps, Secrets, requests/limits, probes и PodDisruptionBudgets. Опыт построения и сопровождения CI/CD в GitLab. Опыт работы с Docker и контейнерными реестрами. Опыт работы с одним из крупных облачных провайдеров. Опыт Yandex Cloud будет преимуществом. Понимание облачных сетей: подсети, маршруты, NAT, VPN, security groups, load balancers и DNS. Опыт настройки nginx или ingress-nginx. Умение работать с PostgreSQL или MySQL: резервное копирование, репликация, мониторинг и восстановление. Опыт эксплуатации систем мониторинга и журналирования. Понимание принципов IAM, управления секретами и минимальных привилегий. Опыт автоматизации инфраструктуры и повторяющихся операций. Умение диагностировать проблемы распределённых систем по логам, метрикам и сетевым трассировкам. Готовность документировать изменения и создавать понятные инструкции. Будет преимуществом Опыт работы с Yandex Cloud и его CLI/API. Опыт эксплуатации Managed Kubernetes в Yandex Cloud. Знание Terraform. Опыт работы с Helm, Argo CD или аналогичными GitOps-инструментами. Опыт эксплуатации Kafka и контроля consumer lag. Практический опыт работы с MongoDB и Redis/Valkey. Опыт настройки Loki, Prometheus и Grafana. Опыт сопровождения webhook и интеграций с маркетплейсами. Опыт построения отказоустойчивой инфраструктуры в нескольких зонах доступности. Опыт проведения security-аудита облачной инфраструктуры. Знание Python, Bash или другого языка автоматизации. Опыт работы с высоконагруженными системами обработки заказов и складской логистикой. Что мы ожидаем от подхода к работе Сначала разобраться в существующей системе, а затем предлагать изменения. Не вносить изменения в production без понятного плана и возможности отката. Не хранить пароли, токены и ключи в исходном коде и CI/CD-конфигурациях. Проверять восстановление из резервных копий на практике. Устранять первопричины инцидентов, а не только их последствия. Объяснять технические решения понятным языком. Фиксировать архитектуру, зависимости и порядок действий при авариях. Ожидаемый результат работы Понятная и актуальная документация по инфраструктуре. Управляемые и воспроизводимые процессы доставки приложений. Минимально необходимые права доступа. Контролируемые публичные точки входа. Проверенные резервные копии и инструкции по восстановлению. Мониторинг технических и бизнес-показателей. Снижение количества аварий и времени восстановления. Прозрачное использование ресурсов Yandex Cloud.

Откликнуться
Источник: hh · 6 дней назад

Похожие вакансии в городе Екатеринбург

Все вакансии в городе Екатеринбург →