Data Engineer (Kandinsky)
Город:
Москва
Занятость:
Полная занятость
Компания "Сбербанк"
Ищем талантливых специалистов в команду Управления базовых моделей Kandinsky.
Kandinsky — линейка моделей для генерации изображений и видео по текстовому описанию. Наша команда занимается обучением и развитием модели, аналитикой и построением метрик её работы, специализируется на создании инновационных решений в области искусственного интеллекта и нейросетей. Мы разрабатываем модели, направленные на улучшение взаимодействия между человеком и AI, автоматизацию процессов анализа больших объемов данных, распознавание изображений и обработку естественного языка, а также создание креативных инструментов для автоматической генерации визуального контента высокого уровня.
Обязанности
- проектирование и разработка ETL/ELT-пайплайнов для обработки изображений и видеоданных, как в экосистеме Apache Airflow, так и в формате автономных Python-скриптов.
- автоматизация процессов загрузки, предобработки и анализа данных: загрузка изображений и видео, обработка полученных данных, определение технических артефактов (например, наличие чёрных полос), трансформация и подготовка данных под требуемые форматы.
- проектирование и поддержка высоконагруженных пайплайнов с возможностью масштабирования на распределённую обработку.
- разработка высоконагруженных процессов нарезки, сжатия и конвертации видеофайлов крупного размера с использованием оптимизированных инструментов (ffmpeg, multiprocessing, async-подходы)
- реализация механизмов отслеживания состояния и истории данных: учёт уже обработанных файлов, планирование задач по догрузке, ведение служебных таблиц
- поддержка платформы данных: создание и оптимизация DDL/DML-скриптов, настройка таблиц под аналитические и операционные нагрузки
- подготовка датасетов по требованиям внутренних и внешних заказчиков, обеспечение качества и полноты данных
- поддержка CI/CD-процессов и стандартизация кодовой базы в соответствии с инженерными практиками и паттернами проектирования.
Требования
- уверенный практический опыт разработки ETL-процессов с использованием Apache Airflow либо аналогичных систем оркестрации
- опыт работы с S3 или совместимыми объектными хранилищами, понимание структуры и принципов организации data-lake
- понимание принципов распределённой обработки данных и работы PySpark
- уверенные навыки разработки на Python, включая использование асинхронных инструментов, многопроцессной обработки, работы с большими файлами и медиа-данными
- опыт написания Bash-скриптов для автоматизации рутинных процессов.
- глубокое понимание принципов проектирования чистой архитектуры, шаблонов проектирования и построения легко-поддерживаемых модульных систем
- опыт работы с PostgreSQL и ClickHouse, навыки написания оптимизированных запросов и проектирования таблиц
- опыт работы с Docker и Kubernetes, понимание контейнеризации пайплайнов данных.
Условия
- конкурентный уровень заработной платы, годовые премии по результатам работы
- участие в развитии и создании OpenSource продуктов
- корпоративная пенсионная программа, страхование от несчастных случаев, социальные гарантии, ДМС
- комфортный офис Sbergile Home (метро Кутузовская).
19 Ноября
Москва
Компания "Лаборатория Касперского" Стек, который использует команда: ОС: Linux (CentOS/Rocky Linux 8+), Windows Server 2019+ БД: MS SQL,...
20 Ноября
Москва
Компания "SberTech" Присоединяйтесь к команде кибербезопасности СберТеха — мы обеспечиваем безопасность продуктов от идеи до внедрения,...
20 Ноября
Senior DevOps/SRE Engineer (команда RnD)( SberTech )
Москва
Компания "SberTech" Центр Инноваций создает передовые решения на стыке технологий и бизнеса за счет фундаментальных знаний, примененных к рынку...
20 Ноября
Data Scientist / Data Analyst / Quantitative Analyst
Москва
Компания "Remokate" The role: We are looking for a Data Scientist / Quantitative Analyst to strengthen our trading research and analytics. You...
20 Ноября
Head of Data Science (fintech)
Москва
Компания "Мокка" Мокка – это самый популярный в России и Восточной Европе финтех сервис в сегменте BNPL (Buy Now Pay Later – Покупай сейчас,...
Вакансия размещена в отрасли