ML-Ops инженер
Описание
«Детмир Тех» — команда, развивающая цифровую экосистему группы компаний «Детский мир». Делаем продукты для миллионов клиентов и сервисы, которые помогают бизнесу работать быстрее. Кого ищем:ИИ-платформа «Детского Мира» уже работает в проде: LLM-гейтвей с квотами, RAG, агентные сценарии, трассировка и собственный инференс на GPU. Ищем MLOps-инженера ИИ-платформы и агентской платформы. Основная задача роли - работа над качеством решений и улучшение утилизации ресурсов (GPU/токены). Чем предстоит заниматься: Строить систему оценки качества LLM-решений: golden set, LLM-as-judge, метрики retrieval (recall@k, groundedness), регрессионные гейты промптов и RAG в CI. Развивать ML мониторинг: дашборды p95, RPS, uptime, утилизации GPU и расхода токенов, централизованные логи, алерты. Управлять инференсом: собственный vLLM плюс внешние модели через провайдеров - роутинг по сложности, fallback, semantic cache. Настраивать квоты GPU и токенов по командам и доменам, приоритетные очереди, учёт стоимости в рублях. Искать проблемы с качествов на живом трафике раньше, чем поступят жалобы пользователей. Развивать CI/CD: eval-гейты, canary, откат; тестовый контур, бэкапы и восстановление. Развивать STT-контур: транскрипция и саммеризация встреч. Что ожидаем от вас: Опыт вывода ML-моделей в production и их сопровождения; Практический опыт с Docker, Kubernetes и CI/CD; Понимание полного жизненного цикла ML-модели: эксперименты, валидация, версионирование моделей и данных, Model Registry; Опыт разработки ML-платформ и сервисов, а не только поддержки инфраструктуры; Понимание принципов мониторинга ML-систем: latency, uptime, error rate, drift данных и моделей, контроль качества и алертинг; Опыт построения и сопровождения асинхронных пайплайнов; Знание Kafka или RabbitMQ; Уверенный Python: автоматизация, скрипты, ML-пайплайны, работа с API; Понимание подходов к оценке качества LLM и AI-агентов: eval-датасеты, сценарные метрики, LLM-as-a-Judge. Будет плюсом: Опыт LLMOps: vLLM, Triton, кэширование, батчинг, оптимизация затрат на инференс; Опыт работы с Langfuse, LangSmith или OpenTelemetry; MLflow, ClearML, Kubeflow или W&B; Terraform / Ansible; GitLab CI / GitHub Actions; Опыт работы с GPU-кластерами. Мы предлагаем: Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию; Совокупный доход: оклад + годовой бонус; График работы: 5/2 (гибридный формат работы/ удаленный); Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается; Техника для работы; Полис ДМС; Программа Best Benefits; Внутреннее обучение; Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании. Присоединяйтесь к нам и станьте частью истории бренда с историей!