Lead data platform developer
Описание
Основные задачи: Проектировать масштабируемую, надёжную и производительную архитектуру единой платформы данных; Разрабатывать и сопровождать техническую дорожную карту платформы, синхронизированную с бизнес-целями и потребностями исследователей; Анализировать и обеспечивать характеристики scalability, reliability и performance ключевых компонентов; Проектировать и внедрять системы оркестрации многоэтапных пайплайнов обработки данных; Разрабатывать ключевые компоненты платформы: панель управления, оркестраторы, агенты, API, SDK; Создавать и развивать self-service инструменты, позволяющие дата-инженерам и аналитикам автономно запускать, мониторить и контролировать пайплайны; Обеспечивать мультитенантность, разграничение доступа и аудит-логирование действий пользователей; Обеспечивать целостность, надёжность и безопасность данных на всех этапах обработки; Оптимизировать использование вычислительных и storage-ресурсов: проводить capacity planning, performance benchmarking, выявлять и устранять узкие места; Развивать observability-направление: мониторинг, APM, алертинг для своевременного обнаружения деградаций; Формировать и внедрять технические стандарты платформенной команды: архитектурные принципы, подходы к надёжности, code review, требования к документации; Систематизировать процессы разработки, унифицировать технологический стек и инструментарий; Систематизировать и вести техническую документацию по платформенным сервисам и архитектурным решениям. Требования: Опыт проектирования горизонтально масштабируемых, отказоустойчивых data-intensive систем на bare-metal/VM-инфраструктуре и/или в Kubernetes; Понимание архитектурных компромиссов и умение выбирать решения под конкретные рабочие нагрузки: оркестрация, хранение, доступ, мониторинг; Уверенное владение Python; Опыт разработки бэкенд-сервисов и API с использованием FastAPI; Опыт работы с оркестраторами пайплайнов: Airflow, Dagster и другие; Понимание HTC/HPC-систем; S3-совместимыми хранилищами; Понимание объектного и файлового хранения для нагрузок с интенсивной обработкой данных: производительность, масштабируемость, модели доступа; Опыт построения CI/CD-пайплайнов в GitLab (тестирование, сборка, деплой сервисов платформы); Способность принимать и аргументировать системные архитектурные решения, увязывая требования надёжности, производительности и стоимости; Опыт формирования технических стандартов: архитектурные принципы, code review, инженерная документация, практики эксплуатации. Будет плюсом: Опыт разработки на Go; Глубокое понимание Kubernetes: запуск рабочих нагрузок, модель операторов, сетевые политики, безопасность; Опыт работы с планировщиками типа Slurm; Опыт работы с Singularity/Apptainer контейнерами; Опыт в домене биотехнологий/биоинформатики и понимание специфики рабочих нагрузок (позволит быстрее войти в контекст). Условия: Интересные проекты федерального уровня с минимумом бюрократии, главное – результат; Практическая направленность работы на получение реально работающих уникальных продуктов в сфере генетики / медицины / биологии, на стыке ИТ и передовой науки; Оформление по ТК РФ, достойный уровень з/п; Работа в быстрорастущей, стабильной организации, которой не страшен кризис; График работы 5/2, плавающее начало рабочего дня, гибридный график работы после испытательного срока; Бронь от мобилизации.