Senior Platform Engineer / SRE
Описание
Масштабный технологический проект формирует команду с нуля. Мы разрабатываем интеллектуальную геоинформационную платформу, объединяющую обработку пространственных данных, моделирование сценариев, элементы искусственного интеллекта и высоконагруженные вычисления. В проекте предстоит решать задачи, связанные с большими объемами геоданных, сложными пространственными расчетами, производительностью API и пользовательского интерфейса.Продукт уже имеет работающий MVP и используется в ежедневной деятельности. Сейчас проект активно развивается, и мы ищем Senior Platform Engineer / SRE, который будет обеспечивать надежность и доступность Kubernetes-платформы, отвечать за ее эксплуатацию и последующее развитие. Чем предстоит заниматься: — Автоматизировать и сопровождать развертывание self-managed Kubernetes на виртуальных машинах Linux;— Разбираться с неисправностями и инцидентами, связаными с работой Kubernetes, Linux, контейнерного runtime и сети;— Настраивать и сопровождать сеть платформы, доступ к Kubernetes API, сервисам и данным;— Развивать наблюдаемость, полезные алерты, SLI/SLO и процедуры безопасных изменений;— Сопровождать PostgreSQL и другие stateful-компоненты совместно с технической командой;— Развивать GitLab CI, сборку OCI-образов, Helm/GitOps и безопасные релизы;— Создавать воспроизводимые dev/test/CI окружения и стенды для проверки обновлений, отказов и восстановления;— Вести и внедрять понятную документацию и процессы автоматизации. Что мы ожидаем от кандидата: — Самостоятельный опыт развертывания и эксплуатации Kubernetes; понимание control plane, etcd, kubelet, runtime, CNI, DNS, Service и persistent storage;— Уверенные навыки администрирования Linux и практический опыт траблшутинга;— Понимание сетей Linux и Kubernetes: TCP/UDP, DNS, маршруты, NAT, MTU, Service/EndpointSlice и NetworkPolicy;— Практику автоматизации инфраструктуры: Ansible, Puppet или опыт с сопоставимыми средствами; Terraform или аналоги — при работе с API инфраструктуры;— Умение собирать и диагностировать контейнерные образы: Dockerfile, Containerfile, Docker/BuildKit, либо сопоставимые инструменты;— Опыт CI/CD и декларативной конфигурации; понимание безопасного rollout, проверки результата и ограничений rollback при изменении данных;— Опыт эксплуатации stateful-сервисов и проверок восстановления; понимание различий между репликацией, резервным копированием и восстановлением;— Участие в разборе реальных инцидентов, умение объяснять и аргументировать свои решения и действия;— Английский на уровне B1 для чтения технической документации. Будет плюсом: — Практический опыт работы с Cilium/Hubble, kube-vip или другими решениями для отказоустойчивости Kubernetes;— Опыт работы с CloudNativePG;— Опыт работы с S3-совместимыми или распределенными хранилищами;— Практика GitOps с Flux/ArgoCD, проверкой безопасности образов;— Практика on-prem инфраструктуры, BGP/ECMP и диагностики UDP-трафика. Мы готовы предложить: — Участие в создании масштабного технологического продукта и возможность влиять на его архитектуру;— Работу с нетривиальными задачами на стыке GIS, высоконагруженных вычислений и AI;— Официальное трудоустройство по ТК РФ с первого дня;— ДМС и компенсацию фитнеса;— Испытательный срок — 3 месяца;— Современную технику и полностью оборудованное рабочее место.— Офис в БЦ «Метрополис», Москва;— Возможность согласования гибридного формата работы после прохождения испытательного срока;— Конкурентный уровень дохода, обсуждаемый индивидуально.