Data Engineer (Kandinsky) (в архиве)

29 Января

Партнерские Вакансии

Город:

Москва

Занятость:

Полная занятость

Компания "Сбербанк"

Ищем талантливых специалистов в команду Управления базовых моделей Kandinsky.

Kandinsky — линейка моделей для генерации изображений и видео по текстовому описанию. Наша команда занимается обучением и развитием модели, аналитикой и построением метрик её работы, специализируется на создании инновационных решений в области искусственного интеллекта и нейросетей. Мы разрабатываем модели, направленные на улучшение взаимодействия между человеком и AI, автоматизацию процессов анализа больших объемов данных, распознавание изображений и обработку естественного языка, а также создание креативных инструментов для автоматической генерации визуального контента высокого уровня.

Обязанности

  • проектирование и разработка ETL/ELT-пайплайнов для обработки изображений и видеоданных, как в экосистеме Apache Airflow, так и в формате автономных Python-скриптов.
  • автоматизация процессов загрузки, предобработки и анализа данных: загрузка изображений и видео, обработка полученных данных, определение технических артефактов (например, наличие чёрных полос), трансформация и подготовка данных под требуемые форматы.
  • проектирование и поддержка высоконагруженных пайплайнов с возможностью масштабирования на распределённую обработку.
  • разработка высоконагруженных процессов нарезки, сжатия и конвертации видеофайлов крупного размера с использованием оптимизированных инструментов (ffmpeg, multiprocessing, async-подходы)
  • реализация механизмов отслеживания состояния и истории данных: учёт уже обработанных файлов, планирование задач по догрузке, ведение служебных таблиц
  • поддержка платформы данных: создание и оптимизация DDL/DML-скриптов, настройка таблиц под аналитические и операционные нагрузки
  • подготовка датасетов по требованиям внутренних и внешних заказчиков, обеспечение качества и полноты данных
  • поддержка CI/CD-процессов и стандартизация кодовой базы в соответствии с инженерными практиками и паттернами проектирования.

Требования

  • уверенный практический опыт разработки ETL-процессов с использованием Apache Airflow либо аналогичных систем оркестрации
  • опыт работы с S3 или совместимыми объектными хранилищами, понимание структуры и принципов организации data-lake
  • понимание принципов распределённой обработки данных и работы PySpark
  • уверенные навыки разработки на Python, включая использование асинхронных инструментов, многопроцессной обработки, работы с большими файлами и медиа-данными
  • опыт написания Bash-скриптов для автоматизации рутинных процессов.
  • глубокое понимание принципов проектирования чистой архитектуры, шаблонов проектирования и построения легко-поддерживаемых модульных систем
  • опыт работы с PostgreSQL и ClickHouse, навыки написания оптимизированных запросов и проектирования таблиц
  • опыт работы с Docker и Kubernetes, понимание контейнеризации пайплайнов данных.

Условия

  • конкурентный уровень заработной платы, годовые премии по результатам работы
  • участие в развитии и создании OpenSource продуктов
  • корпоративная пенсионная программа, страхование от несчастных случаев, социальные гарантии, ДМС
  • комфортный офис Sbergile Home (метро Кутузовская).
Похожие вакансии

10 Февраля

Middle QA Engineer (Москва/Якутск)

Москва

Компания "Центр разработки программного обеспечения" Привет! Я Таня, тимлид QA отдела в Драйви. Мы ищем Middle QA инженера в нашу команду....

Отправить резюме подробнее

10 Февраля

Стажер Data Engineer

Москва

Компания "Tele2" Что нужно делать: Поддерживать процессы для продуктовых команд. Принимать участие в разработке продуктов на основе...

Отправить резюме подробнее

10 Февраля

Analytics Engineer / BI Engineer

Москва

Компания "Genesis Group AG" ???? We’re Hiring: Data Analyst ???? Location: Remote ???? About Us Yesim is an international IT...

Отправить резюме подробнее

10 Февраля

Data Scientist( Росгосстрах )

Москва

Компания "Росгосстрах" Мы ищем специалиста, который отвечает за полный цикл жизни AI-решений . От разработки архитектуры и экспериментов до...

Отправить резюме подробнее

10 Февраля

Team Lead (Python\Data)

Москва

Компания "Тинькофф" Мы - команда надежности данных! Мы внедряем практики SRE в данных и помогаем дата-инженерам и аналитикам эффективно работать...

Отправить резюме подробнее

Вакансия размещена в отрасли

Информационные технологии / IT / Интернет: