Платформенный SRE
03 Августа 2026
Город:
Москва
Занятость:
Полная занятость
Компания "SberCloud"
На этой позиции тебе предстоит:
- Участие в продуктовой RUN команде
- Методология наблюдаемости – формировать требования к данным и метрикам; внедрять стандарты надёжности данных и лучшие практики наблюдаемости
- Анализ потоков и метрик – работать с Prometheus, Loki, OpenTelemetry и др.; выявлять отклонения, узкие места и возможности оптимизации
- Data QA (контроль качества данных) – проверять полноту, корректность и соответствие требованиям; автоматизировать проверки через Quality Gates (правильность схемы, покрытие метрик, отсутствие дублирования, соответствие SLA/SLO) → оценка качества перед попаданием в прод
- Тестирование и R&D Ops - писать и поддерживать автоматические тесты компонентов мониторинга; проверять наличие и корректность метрик, логов, трассировок после деплоя; планировать тесты надёжности (отказы узлов, сетевые задержки, падения зависимостей) и канарейковые/теневые развертывания с автоматическим откатом; проводить нагрузочное тестирование, сравнивать результаты с базовым профилем; исследовать новые технологии, собирать метрики,готовить рекомендации; интегрировать Quality Gates в CI/CD – каждый релиз проходит проверку качества и надёжности; отслеживать эффективность через SRE‑KPIs (MTTR, доля неудачных изменений, коэффициент успешных хаос‑тестов, переход PoC → прод) и публиковать их в дашбордах
- Разбор инцидентов и RCA – анализировать логи, трассировки, метрики, ETL‑pipeline; документировать причины, фиксировать ошибки, предлагать решения; вести базу знаний (post‑mortem, операционные руководства)
- Техническая документация – создавать и актуализировать схемы потоков данных, инструкции, описания архитектуры платформы
- Развитие внутренней платформы мониторинга – улучшать функциональность и производительность; автоматизировать наблюдаемость и оповещения как код ); интегрировать пороги проверки качества в CI/CD для проверки перед деплоем
- Обучение и передача знаний – готовить обучающие материалы, проводить воркшопы. Способствовать принятию единых практик наблюдаемости
Что мы ждем от кандидата:
- Знаете, как сделать отказоустойчивый масштабируемый сервис
- Имеете опыт написания и ревью технической документации Имеете опыт коммуникации с разработчиками и бизнесом (объяснение компромиссов между надёжностью и разработкой функций)
- Обладаете системным мышлением и умением анализировать сложные сценарии отказа, выявлять корневые причины, находить способы их устранения
- Имеете практический опыт построения и внедрения quality gates в CI/CD процесс для управления рисками при развертывании: для предотвращения попадания нестабильных изменений в прод
- Знаете, как определять SLI\SLO для сервиса, у которого нет исторических данных о надежности
- Знаете, как рассчитать композитные SLO для сервиса, зависящего от 10+ микросервисов
- Имеете опыт внедрения наблюдаемости как код (observability as code), оповещения как код (alerting as code))
Зарегистрируйтесь или войдите, чтобы открыть контакты работодателя
Прикрепите резюме для отклика
Уже с нами?
Войдите, чтобы отправить резюме
18 Июля
Devops / SRE-инженер (ClickHouse, Kafka)
Москва
Компания "Амбрелла" DevOps / SRE-инженер с экспертизой ClickHouse и Kafka Приветствую! Меня зовут Эля, я являюсь HR компании «Амбрелла —...
19 Июля
Москва
Компания "Rambler Group" Rambler&Co – крупнейший медиахолдинг России по объему аудитории цифровых ресурсов, 40% пользователей Рунета...
20 Июля
SRE-инженер middle+/senior (Инженер базы данных PostgreSQL )
Москва
Компания "Альфа-Банк" Мы в поиске SRE‑инженера Middle+ /Senior , который будет отвечать за сопровождение, развертывание и поддержание...
20 Июля
Москва
от 200 000 до 250 000 руб.
Компания "ТМГТ" О роли Мы выделяем надёжность в отдельную полноценную функцию и ищем двух инженеров, которые возьмут на себя SLO,...
21 Июля
Москва
Компания "Tele2" Что нужно делать: Проводить ревизию релиза. Подготавливать продуктивную среду для установки релиза. Взаимодействовать...
Вакансия размещена в отрасли