Data Engineer (senior)
07 Августа 2026
Город:
Москва
Занятость:
Полная занятость
Компания "Лоция"
Цели проекта: участие в развитии сбора, обработки, трансформации и представления данных.
Чем предстоит заниматься:
- проектированием и разработкой слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
- разработкой и внедрением кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
- формализацией бизнес-правил качества данных в код, настройкой уровней доверия к источникам и правил выживания (survivorship rules);
- внедрением Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
- настройкой автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Чего мы ждем от тебя:
- SQL и трансформации: продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
- Python для данных: уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
- Fuzzy Matching: практический опыт применения библиотек нечёткого поиска и связывания записей (например, Splink, recordlinkage, dedupe, theFuzz);
- алгоритмы: понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
- моделирование данных: глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
- Data Quality: Опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
- оркестрация и DevOps: опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Будет существенным преимуществом:
- опыт обучения простых ML-моделей (Logistic Regression, XGBoost) или использование Active Learning для классификации дублей;
- понимание принципов вероятностного связывания записей (Probabilistic Record Linkage, модель Фелледжи-Сантера);
- опыт работы с графовыми базами данных или графовыми алгоритмами (Connected Components) для разрешения сущностей;
- знание специфики работы с Greenplum и stream lakehouse.
Зарегистрируйтесь или войдите, чтобы открыть контакты работодателя
Прикрепите резюме для отклика
Уже с нами?
Войдите, чтобы отправить резюме
29 Июля
Ведущий инженер / Senior Data Engineer по развитию корпоративного DWH
Москва
Компания "Проммикс" Мы — динамично развивающаяся производственная компания. Наше основное направление — создание и реализация качественной...
30 Июля
MLOps-инженер в инфраструктуру Центра ИИ, senior
Москва
Компания "СКБ Контур" Контур — экосистема для бизнеса. Наши сервисы помогают каждой третьей компании России делать рабочие процессы проще и...
31 Июля
Middle+ / Senior Data Engineer / ETL-разработчик
Москва
Компания "SpbDev" Мы — аутсорсинговая IT-компания, специализирующаяся на Data Engineering, DevOps и поддержке сложных корпоративных систем....
31 Июля
Москва
Компания "SpbDev" Мы — аутсорсинговая IT-компания, специализирующаяся на разработке и развитии корпоративных информационных систем, Data...
01 Августа
Senior Manual QA (Back-end, Linux)
Москва
Компания "Made of Storm" Привет! Made of Storm в поиске Senior Manual QA (Back-end Testing) для аккредитованной IT компании (разработчик B2B...
Вакансия размещена в отрасли