Руководитель ИТ инфраструктуры и эксплуатации
Описание
Чем предстоит заниматься: Стратегия и управление Разработка и внедрение стратегии развития ИТ-эксплуатации и инфраструктуры; Формирование и управление бюджетом отдела (CAPEX/OPEX), контроль затрат на облачные сервисы, оборудование, лицензии; Планирование мощностей, модернизация и вывод инфраструктуры из эксплуатации. Команда и процессы Руководство командой из 23 инженеров: найм, онбординг, развитие, мотивация, оценка эффективности; Построение и оптимизация процессов эксплуатации: мониторинг, инцидент- и проблем-менеджмент, change management, автоматизация CI/CD для инфраструктуры; Внедрение и развитие практик SRE и DevOps-культуры совместно с командой разработки; Выстраивание процессов поддержки (L0–L2) и клиентского сервиса. Техническая эксплуатация и безопасность Обеспечение SLA/SLO бизнес-критичных сервисов; Резервное копирование, disaster recovery, отказоустойчивость систем; Информационная безопасность инфраструктуры (патчинг, конфигурация, соответствие политикам); Управление облачной и физической инфраструктурой. Взаимодействие Тесная работа с руководителями разработки, продукта, информационной безопасности и бизнес-подразделений. Отчётность перед руководством по ключевым метрикам, инцидентам и исполнению бюджета. AI-платформа (будет плюсом) Эксплуатация и развитие внутренней AI-инфраструктуры: LiteLLM, LibreChat, MCP-серверы, n8n; Обеспечение доступности и безопасности компонентов AI-платформы; Управление доступом к языковым моделям: маршрутизация запросов, контроль расходов, квоты. Требования: Опыт в эксплуатации ИТ-инфраструктуры от 10 лет, из них от 5 лет — на руководящей позиции; Глубокие технические знания: облачные платформы, Linux/Windows-серверы, сети, виртуализация, контейнеризация (Docker, Kubernetes); Опыт построения процессов эксплуатации с нуля или их существенного развития: инцидент-менеджмент, мониторинг (Prometheus, Grafana, Zabbix), CI/CD; Понимание принципов DevOps, SRE и Infrastructure as Code (Terraform, Ansible); Навыки управления бюджетом и планирования; Опыт найма, развития и оценки сотрудников Знание Python/Bash для скриптинга и автоматизации; Готовность к работе в условиях неопределённости и высокой нагрузки (в моменты инцидентов); Будет плюсом: практический опыт с AI/LLM-инструментами (создание AI-агентов, работа с LLM-шлюзами, автоматизация через AI).