Инженер вычислительного кластера (HPC)
Описание
Чем предстоит заниматься: Устанавливать, конфигурировать и вводить в эксплуатацию CPU- и GPU-серверы; Проводить диагностику оборудования, обновлять прошивки, настраивать BIOS/BMC и тестировать компоненты; Устанавливать и сопровождать Linux на управляющих и вычислительных узлах; Подключать новые серверы и вычислительные узлы к Slurm-кластеру; Настраивать и сопровождать разделы, очереди, лимиты, квоты и учет использования ресурсов; Диагностировать проблемы запуска и выполнения вычислительных заданий; Устанавливать и обновлять драйверы, системные библиотеки и вычислительное программное обеспечение; Создавать и сопровождать пользовательские программные и контейнерные окружения; Автоматизировать установку операционных систем, настройку серверов и развертывание инфраструктурных сервисов; Поддерживать инфраструктурные конфигурации в системе контроля версий; Настраивать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm; Участвовать в настройке централизованного логирования и оповещений; Реагировать на инфраструктурные инциденты, локализовать причины сбоев и участвовать в их устранении; Поддерживать резервное копирование критических конфигураций и сервисов; Настраивать сетевое взаимодействие между управляющими узлами, вычислительными серверами и системами хранения; Участвовать в эксплуатации файловых систем и хранилищ данных; Контролировать состояние и загрузку CPU-, GPU-, сетевых и storage-ресурсов; Участвовать в тестировании новых конфигураций оборудования и системного программного обеспечения; Помогать внутренним командам переносить вычислительные задачи в общий HPC-контур; Помогать пользователям диагностировать проблемы с вычислительными окружениями и заданиями; Участвовать в интеграции HPC-инфраструктуры с внутренней вычислительной платформой; Вести техническую документацию по оборудованию, конфигурациям и эксплуатационным процедурам. Что мы ожидаем: Уверенный практический опыт администрирования Linux; Опыт эксплуатации физических серверов; Понимание устройства серверных платформ, CPU, GPU, оперативной памяти, дисковых и сетевых подсистем; Практический опыт работы со Slurm или другим планировщиком вычислительных задач; Понимание основных принципов работы компьютерных сетей и систем хранения данных; Опыт автоматизации инфраструктуры с помощью Ansible или аналогичных инструментов; Навыки написания скриптов на Bash или Python; Опыт работы с системами мониторинга и логирования; Понимание контейнерных технологий; Умение диагностировать проблемы на уровнях оборудования, операционной системы, сети, драйверов и Slurm; Готовность работать как с автоматизацией, так и непосредственно с физическим оборудованием; Аккуратность при выполнении инфраструктурных изменений; Умение самостоятельно доводить инженерные задачи до работающего результата; Способность документировать выполненные работы и передавать знания команде.