Ведущий SRE

Lamoda Tech
Москва •Опубликовано 9 сентября 2026
Зарплата не указана
Полная занятостьболее 6 летПрограммист
Зарплата не указана

Описание

Чем предстоит заниматься:

  • Повышать надёжность ИТ-сервисов, развивать процессы, повышающие надёжность ИТ-сервисов и инфраструктуры;
  • Участвовать в разборах инцидентов и проблем, выявлять риски и эксплуатации;
  • Участвовать в процессе архитектурного ревью ИТ-сервисов и инфраструктуры;
  • Автоматизировать и внедрять практики SRE;
  • Контролировать актуальность технической документации.

Мы ожидаем:

  • Опыт развертывания, администрирования и траблшутинга высоконагруженных систем оркестрации контейнеров, как on-prem, так и в публичных облаках (у нас Kubernetes);
  • Понимание подхода IaC и управления конфигурациями (у нас Ansible и Terraform) и умение его применять;
  • Опыт построения систем наблюдаемости, как системных, так и прикладных решений. Понимание, какие метрики собирать, куда смотреть при проблемах, какие дашборды для этого нужны (мы используем Prometheus/Grafana);
  • Понимание принципов и опыт построения отказоустойчивых сервисов и эксплуатации высоконагруженных систем (Web-серверов, СУБД, приложений);
  • Опыт построения процесса непрерывного резервного копирования инфраструктурных компонентов.
  • Опыт разработки на Python/GO.

Будет плюсом:

  • Опыт администрирования: Kafka, RabbitMQ, PostgreSQL, Redis;
  • Знание и умение применять практики SRE;
  • Опыт в тестировании систем на отказоустойчивость и нагрузку (нагрузочное тестирование, Chaos Engineering);
  • Опыт в разработке планов аварийного восстановления (DRP).
Описание

Чем предстоит заниматься:

  • Повышать надёжность ИТ-сервисов, развивать процессы, повышающие надёжность ИТ-сервисов и инфраструктуры;
  • Участвовать в разборах инцидентов и проблем, выявлять риски и эксплуатации;
  • Участвовать в процессе архитектурного ревью ИТ-сервисов и инфраструктуры;
  • Автоматизировать и внедрять практики SRE;
  • Контролировать актуальность технической документации.

Мы ожидаем:

  • Опыт развертывания, администрирования и траблшутинга высоконагруженных систем оркестрации контейнеров, как on-prem, так и в публичных облаках (у нас Kubernetes);
  • Понимание подхода IaC и управления конфигурациями (у нас Ansible и Terraform) и умение его применять;
  • Опыт построения систем наблюдаемости, как системных, так и прикладных решений. Понимание, какие метрики собирать, куда смотреть при проблемах, какие дашборды для этого нужны (мы используем Prometheus/Grafana);
  • Понимание принципов и опыт построения отказоустойчивых сервисов и эксплуатации высоконагруженных систем (Web-серверов, СУБД, приложений);
  • Опыт построения процесса непрерывного резервного копирования инфраструктурных компонентов.
  • Опыт разработки на Python/GO.

Будет плюсом:

  • Опыт администрирования: Kafka, RabbitMQ, PostgreSQL, Redis;
  • Знание и умение применять практики SRE;
  • Опыт в тестировании систем на отказоустойчивость и нагрузку (нагрузочное тестирование, Chaos Engineering);
  • Опыт в разработке планов аварийного восстановления (DRP).

Похожие вакансии

Менеджер по продажам
Семенов Антон Петрович
80000 – 150000 руб.
Полная занятостьОпыт 1–3 года
Бухгалтер
Аникин Групп
96600 – 120000 руб.
Полная занятостьОпыт 3–6 лет
Дизайнер / Senior Designer
Рокин Филипп Сергеевич
120000 – 300000 руб.
Полная занятостьОпыт 3–6 лет
Дизайнер по обработке фотографий
Гасанов Руслан Абидипович
от 50000 руб.
Полная занятостьОпыт 1–3 года
Дизайнер рекламных креативов
ПЕРСОНАЛ
Зарплата не указана
Полная занятостьОпыт 1–3 года
Менеджер по развитию ключевых клиентов / Customer Success Manager
Data Light
150000 – 200000 руб.
Полная занятостьОпыт 3–6 лет