Все вакансии России 0

SRE/Site Reliability Engineer

з/п не указана
Cloud.ru
Москва Постоянная занятость Удаленная работа

Описание

На этой позиции тебе предстоит: Отвечать за production Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI, метрики, алерты, ранбуки и дашборды для продукта Повышать наблюдаемость и надежность продукта Участвовать в устранении аварий и последующей стабилизации продукта Участвовать в заполнении и разборе постмортемов Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов Автоматизировать рутинную работу Разрабатывать DRP Участвовать в разработке процессов, используемых в работе Что мы ждем от кандидата: Свободно и на экспертном уровне работаете с Linux-системами и занимались их промышленной эксплуатацией Понимаете, что такое load balancing, circuit breakers, disaster recovery и т.п. Понимаете, что такое SLO и SLI и умеете применять их на практике Имеете опыт работы с Grafana, Prometheus, k8s Понимаете принципы IaC-подхода к описанию инфраструктуры; понимаете, как работают сети и умеете диагностировать и решать проблемы в их работе Дополнительно пишете на Go / Python / bash и т.п. в объеме, достаточном для автоматизации повседневной работы; имеете практический опыт работы SRE; знаете, как сделать отказоустойчивый масштабируемый сервис; умеете работать с системами управления

Откликнуться
Источник: hh · 3 дня назад

Похожие вакансии в городе Москва

Все вакансии в городе Москва →