Главный разработчик MLOps
Описание
Чем ты будешь заниматься Разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, inference-сервисы, прикладные сервисы и необходимые инфраструктурные компоненты. Проектировать, настраивать и оптимизировать инфраструктуру для ML/LLM inference, обеспечивать масштабирование, отказоустойчивость и эффективное использование вычислительных ресурсов. Автоматизировать развертывание ML-сервисов и моделей с использованием Helm, ArgoCD и CI/CD, развивать GitOps-подходы. Управлять инфраструктурой и облачными ресурсами через Terraform, разрабатывать и поддерживать Terraform-модули. Развивать мониторинг и observability ML-систем: метрики, логирование, алертинг, контроль доступности и производительности inference-сервисов. Совместно с ML- и backend-разработчиками улучшать процесс вывода решений из эксперимента в production и инструменты для разработки, тестирования и эксплуатации ML-систем. Мы ожидаем опыт 3+ лет в DevOps/MLOps или ML-разработке; владение Kubernetes и облачными технологиями; навыки работы с Helm, ArgoCD и написание Terraform-модулей; практика работы с мониторингом, логированием и ML-инференс серверами.