Системный инженер (ItOps) внутренней инфраструктуры
Описание
OneCell — российская MedTech компания. Мы хотим, чтоб каждый человек мог быстро и без лишних трат получить диагноз по онкологии, а также второе мнение. Чтобы обеспечить это мы единственные в стране разработали собственный цифровой гистологический сканер и AI-платформу для патоморфологической диагностики (основной инструмент для совместной работы патологов, клиницистов и радиологов).Почему мы ищем человека:Расширение команды ItOps.Работа делится примерно пополам: половина — поток обращений от коллег, половина — инциденты внутреннего контура и инфраструктурные проекты.С кем предстоит работать ItOps: руководитель отдела и сисадмин. DevOps: делают IaC-шаблоны, пайплайны и стандарты, которые мы применяем. К ним же эскалируем, если дефект в самом инструменте. Эксплуатация: клиентские окружения. С ними пересекаемся на каналах связи до площадок заказчиков. Информационная безопасность: формулирует политики, мы их реализуем во внутреннем контуре. Чем предстоит заниматься: Разбирать инциденты внутреннего контура. Примеры: не поднимается прод, упал сервер, не отвечает сервис, не собирается образ микросервиса. Около четырёх инцидентов повышенного приоритета в неделю. Необходимо найти причину и исправить. Инфраструктурные проекты — разрабатывать, внедрять и поддерживать инфраструктурные решения внутреннего контура. Разворачивать и обновлять dev/staging-среды в Kubernetes по шаблонам DevOps. Закрывать поток обращений — около 4–5 в день: доступы и учётные записи к корпоративным системам. Вести онбординг и оффбординг сотрудников под ключ от ноутбука и учёток до полного закрытия доступов при уходе. Развивать корпоративную сеть и VPN: Site to site между дата-центрами, каналы до площадок заказчиков, DNS, маршрутизация, сегментация. Настроить резервное копирование и восстановление ключевых систем с проведённым тестовым восстановлением. Проводить плановые обновления корп-сервисов в окна обслуживания с preflight-бэкапом, проверкой и планом отката. Писать runbook'и и снимать системные причины заявок. Если один и тот же тип обращений повторяется, задача не в том, чтобы закрывать его быстрее, а чтобы он перестал приходить. Наш стек: Kubernetes (managed и bare-metal), ArgoCD, Helm, Ansible, GitLab CI, Proxmox VE, PostgreSQL/Patroni, Ceph / Longhorn / LVM / MinIO, Prometheus / Grafana / Alertmanager / blackbox, Vector / Kafka / ELK, Unbound, nginx (L4/L7), Keycloak. Необходимые знания, навыки и опыт: Linux в продакшене от 3 лет: самостоятельно разбираешься, почему сервис не поднялся — systemd, логи, диски и inodes, права, сеть. Уверенный bash. Kubernetes на уровне эксплуатации и диагностики: читаешь события и логи, понимаешь Pending / CrashLoopBackOff / OOMKilled / ImagePullBackOff, PVC и StorageClass, ingress, requests/limits. Сети: маршрутизация, NAT, iptables, DNS, TLS, MTU. Умеешь доказать, где рвётся связность (tcpdump, ss, traceroute). GitLab CI как рабочий инструмент: читаешь пайплайн, находишь причину падения джобы, понимаешь раннеры и registry. Prometheus/Grafana: напишешь PromQL-запрос и правило алерта. Опыт работы в ServiceDesk-процессе: приоритеты, SLA. Умение управлять сложностью: перед изменением в проде выясняешь, как устроен компонент, и решаешь, как проверить гипотезу. Решение принимаешь сам и можешь объяснить, почему оно верное. Будет преимуществом: Ansible и Terraform, ArgoCD/Helm и GitOps. Proxmox или другой гипервизор, работа с bare-metal. PostgreSQL/Patroni, в том числе операторы. Ceph, Longhorn, MinIO. Vector, Kafka, ELK. Keycloak, LDAP, OIDC. Bind/Unbound, nginx как L4-балансировщик. Работа с LLM-инструментами в ежедневном процессе. Чем заниматься НЕ будешь: Не проектируешь IaC-шаблоны, стандарты развёртывания и архитектуру инфраструктуры — это зона команды DevOps. Мы их применяем и имеем право ставить им требования. Не работаешь с клиентскими окружениями и не поддерживаешь внешних клиентов — это Эксплуатация. Не пишешь политики информационной безопасности — реализуешь их. Что мы предлагаем Cвой bare-metal Kubernetes, гипервизоры, физические сети между дата-центрами и каналы до площадок заказчиков. Прямое влияние на то, как устроена инфраструктура: тут есть что чинить, и решения принимаются быстро.