Инженер данных мастер-систем / Data Engineer
Описание
Мы формируем отдельное направление мастер-данных и ищем инженера, который поможет построить и развивать его технический контур. Операционные хранилища, интеграционные потоки, история изменений, правила обработки и контроль консистентности данных. Чем предстоит заниматься: Проектировать структуры операционных хранилищ и модели мастер-данных. Разрабатывать процессы загрузки, обработки, хранения и передачи данных. Создавать пакетные и потоковые интеграции между информационными системами. Настраивать получение изменений из систем-источников, включая CDC-механизмы. Реализовывать правила нормализации, сопоставления, дедупликации и консолидации данных. Обеспечивать хранение истории изменений мастер-данных. Готовить данные для передачи в DWH и другие системы-потребители. Разрабатывать проверки качества данных, технические и бизнес-сверки. Настраивать мониторинг, логирование и обработку ошибок. Анализировать причины расхождений, задержек и сбоев в интеграционных процессах. Участвовать в выборе архитектурных и технологических решений. Сопровождать и развивать разработанные решения в промышленной эксплуатации. Что для нас важно: Уверенное владение SQL. Опыт разработки на Python. Опыт проектирования структур и моделей хранения данных. Опыт создания ETL- или ELT-процессов. Понимание принципов пакетной и потоковой обработки данных. Понимание интеграционных паттернов и способов передачи данных между системами. Навыки работы с реляционными СУБД. Понимание механизмов обеспечения целостности и консистентности данных. Опыт настройки логирования, мониторинга и обработки ошибок. Умение самостоятельно прорабатывать техническое решение и доводить его до промышленной эксплуатации. Будет преимуществом: Опыт работы с Kafka, Flink или Debezium. Практический опыт реализации CDC-процессов. Опыт разработки процессов в Apache Airflow. Опыт работы с ClickHouse. Участие в создании MDM-решений, мастер-систем или операционных хранилищ. Опыт реализации правил сопоставления, дедупликации и консолидации данных. Опыт построения систем контроля качества данных и автоматизированных сверок. Понимание событийно-ориентированной архитектуры. Опыт интеграции с API, брокерами сообщений и внешними информационными системами. Опыт работы с Git, CI/CD и контейнеризацией. Основной технологический стек: Python; SQL; PostgreSQL; Microsoft SQL Server; Apache Airflow. Технологии интеграционного и потокового контура: Apache Kafka; Apache Flink; Debezium; ClickHouse.