Linux-инженер (сопровождение on-premise AI-платформы)
Описание
Мы — группа IT-компаний Lad: 34 года помогаем бизнесу автоматизировать процессы и внедрять новые технологии, более 500 специалистов в команде. В 2025 году вошли в ТОП-100 работодателей России и заняли 1 место среди IT-компаний Нижегородской области. Ladcraft — платформа автономных ИИ-агентов для бизнеса. Разворачивается на серверах заказчика в изолированной сети, без доступа в интернет, и работает в Kubernetes; часть инсталляций использует локальный инференс моделей на GPU. Ваша задача — обеспечивать стабильную работу этой инфраструктуры. Чем предстоит заниматься: Анализировать логи и метрики заказчиков: системные логи, логи сервисов, дашборды Grafana, метрики Prometheus. Обновлять компоненты по инструкциям от команды разработки: пакеты, сервисы, бандлы. Готовить хосты к установке: базовая настройка ОС (Альт Сервер 10.4 / Debian / Ubuntu / Astra SE 1.7, 1.8), проверка ресурсов, сети и файловых систем. Настраивать и диагностировать GPU: доступность видеокарт, драйверы, распределение видеопамяти между LLM-моделями, контроль температур и загрузки. Разбирать инциденты в Kubernetes: падающие поды, нехватка ресурсов, OOMKill, CrashLoopBackOff, проблемы с Ingress, ConfigMaps, Secrets, PVC. Локализовать лёгкие и средние инциденты, применять типовые решения и эскалировать с полным контекстом: логи, метрики, шаги, гипотезы. Взаимодействовать с DevOps и разработкой, готовить репродукции проблем. Общаться с заказчиком в чатах и по почте: собирать данные по инциденту, согласовывать окна обновлений, отчитываться о результатах. Развертывать платформу в закрытых контурах. Первоначальная настройка контура. Что мы ожидаем: Linux на уровне уверенного пользователя: процессы и нагрузка, службы, файловые системы и сетевые соединения. Уверенное владение Kubernetes: архитектура кластера, работа с kubectl, диагностика подов, понимание Ingress, Services, ConfigMaps, Secrets, PVC/StorageClass, ResourceQuota, HPA. Умение читать манифесты и понимать, что в них не так. Понимание сетей: TCP/UDP, DNS, MTU, базовая диагностика. Опыт работы с мониторингом: Prometheus, Grafana, Loki — чтение дашбордов, поиск аномалий. Понимание HTTP-кодов ошибок (502, 504) и их причин в инфраструктуре с прокси и балансировщиком. Базовый bash для простых скриптов диагностики. Понимание принципов systemd: unit-файлы, зависимости, статусы служб. Понимание работы локального инференса: видеопамять и требования моделей, диагностика нехватки видеопамяти, знакомство с утилитами мониторинга GPU. Умение самостоятельно выстраивать план диагностики: ОС → Kubernetes → приложение → сеть. Коммуникационные навыки: чётко формулировать вопросы, собирать нужные данные и объяснять статус и дальнейшие шаги инженерам и руководителям проектов заказчика. Готовность вовремя признавать незнание и эскалировать, спокойствие в инцидентах: сначала факты, потом действия. Мы предлагаем: Официальное трудоустройство, полная занятость. Удалённый формат работы, в Нижнем Новгороде возможен гибрид. Гибкое начало рабочего дня (9:00–11:00 по МСК). Команда разработки и DevOps рядом: помогают, но ожидают самостоятельности в своей зоне. Обучение и развитие: Lad Универ, внешние тренинги и митапы, выстроенный онбординг, индивидуальный план развития. ДМС, чекапы, компенсация спорта. Оплачиваемый выходной в день рождения, магазин мерча.