Ведущий инженер DevOps

Т1
Москва •Опубликовано 25 сентября 2026
Зарплата не указана
Полная занятость3–6 летПрограммист
Зарплата не указана

Описание

Чем предстоит заниматься:
  • Отвечать за надёжность и стабильную работу закреплённых ключевых сервисов облачной платформы в production.
  • Глубоко разбираться в устройстве сервисов, их компонентах, зависимостях и сценариях отказа.
  • Участвовать в выводе новых сервисов и версий в production, обеспечивать безопасный и воспроизводимый deployment.
  • Разрабатывать и поддерживать Helm charts и deployment-конфигурации.
  • Помогать командам разработки с подготовкой и выполнением deployment в production.
  • При необходимости самостоятельно настраивать и доустанавливать необходимые инфраструктурные компоненты в production.
  • Организовывать получение необходимых доступов и взаимодействовать с профильными инфраструктурными командами.
  • Настраивать и развивать мониторинг, метрики, логирование, алертинг и другие средства observability.
  • Контролировать работу сервисов в production и выявлять деградации и потенциальные проблемы до их влияния на клиентов.
  • Участвовать в расследовании инцидентов, ошибок и деградаций, определять первопричины и координировать их устранение.
  • Анализировать повторяющиеся проблемы и инициировать изменения, предотвращающие их повторное возникновение.
  • Участвовать в postmortem и улучшении эксплуатационных процессов.
  • Автоматизировать рутинные операции и снижать объём ручной работы.
  • Участвовать в определении и контроле SLI/SLO для закреплённых сервисов.
  • Оценивать влияние технических проблем на доступность, производительность и основные пользовательские функции сервисов.
  • Взаимодействовать с разработчиками на всём жизненном цикле сервиса: от подготовки production до устранения эксплуатационных проблем.

Какие навыки для нас важны:

  • Высшее техническое образование (ИТ, вычислительная техника, автоматизация, телекоммуникации или смежные направления).
  • Опыт работы от 3–5 лет в эксплуатации, SRE, DevOps, Platform Engineering или близких направлениях. Желателен опыт сопровождения высоконагруженных или критичных production-сервисов.

Знания и навыки:

  • Linux на уровне продвинутого администратора/инженера.
  • Kubernetes.
  • Helm.
  • CI/CD и принципы автоматизированного deployment.
  • Мониторинг и observability: метрики, логи, алертинг.
  • Понимание принципов отказоустойчивости и эксплуатации production-систем.
  • Навыки диагностики проблем и анализа первопричин.
  • Git.
  • Умение работать с API, CLI и shell/python-скриптами.
  • Понимание сетевого взаимодействия и основных инфраструктурных компонентов.
  • Готовность глубоко разбираться в устройстве закреплённых сервисов.
  • Практический опыт SRE-подхода: SLI/SLO, error budget, incident/problem management.
  • Опыт эксплуатации OpenStack или других облачных платформ.
  • Prometheus, Grafana, Loki/ELK/OpenSearch или аналогичные системы.
  • Опыт работы с PostgreSQL, Redis, Kafka/RabbitMQ или другими распределёнными компонентами.
  • Опыт построения и улучшения production-инфраструктуры.
  • Опыт performance/capacity анализа.
  • Опыт автоматизации рутинных операций.
  • Знание принципов release engineering и безопасного rollout.
  • Опыт взаимодействия с командами разработки.

Требования к личным качествам:

  • Высокая ответственность за результат и production.
  • Системное мышление.
  • Умение самостоятельно расследовать незнакомые проблемы.
  • Техническая любознательность и готовность глубоко разбираться в работе сервисов.
  • Проактивность: способность выявлять проблемы до появления обращений от клиентов.
  • Умение конструктивно взаимодействовать с разработчиками и инфраструктурными командами.
  • Способность доводить проблему от обнаружения до устранения первопричины.
  • Способность работать самостоятельно и принимать технические решения.
  • Знание иностранного языка: Английский — чтение технической документации, понимание issue/troubleshooting материалов; B1–B2 и выше.

    Знание стека: Kubernetes, Helm, Linux, Git, CI/CD, Prometheus, Grafana, Docker, REST/API, сетевые технологии, системы логирования и мониторинга. Желательно OpenStack и связанные cloud-инфраструктурные технологии.

    Профессиональные навыки:

  • Deployment и сопровождение сервисов в production.
  • Разработка и поддержка Helm charts.
  • Помощь командам разработки при подготовке и выводе сервисов в production.
  • Настройка production-инфраструктуры и необходимых инфраструктурных компонентов.
  • Подготовка необходимых доступов и взаимодействие с ответственными инфраструктурными командами.
  • Настройка мониторинга, метрик, логирования и алертинга.
  • Контроль production-состояния и раннее выявление деградаций.
  • Анализ incidents и системных ошибок.
  • Поиск root cause и организация устранения проблем.
  • Участие в postmortem и предотвращении повторения инцидентов.
  • Повышение отказоустойчивости и наблюдаемости сервисов.
  • Автоматизация эксплуатационных операций и снижение ручного труда.
  • Участие в определении и контроле SLI/SLO для закреплённых сервисов.
  • Анализ влияния технических проблем на пользовательский опыт и работоспособность основных функций сервиса.
  • Взаимодействие с разработкой на всём жизненном цикле сервиса.

​​​​​​​​​​​​​​Специализированные программы: Kubernetes, Helm, GitLab/GitHub или аналогичные CI/CD-системы, Prometheus, Grafana, системы централизованного логирования, Linux CLI, Terraform/Ansible или аналоги

Описание
Чем предстоит заниматься:
  • Отвечать за надёжность и стабильную работу закреплённых ключевых сервисов облачной платформы в production.
  • Глубоко разбираться в устройстве сервисов, их компонентах, зависимостях и сценариях отказа.
  • Участвовать в выводе новых сервисов и версий в production, обеспечивать безопасный и воспроизводимый deployment.
  • Разрабатывать и поддерживать Helm charts и deployment-конфигурации.
  • Помогать командам разработки с подготовкой и выполнением deployment в production.
  • При необходимости самостоятельно настраивать и доустанавливать необходимые инфраструктурные компоненты в production.
  • Организовывать получение необходимых доступов и взаимодействовать с профильными инфраструктурными командами.
  • Настраивать и развивать мониторинг, метрики, логирование, алертинг и другие средства observability.
  • Контролировать работу сервисов в production и выявлять деградации и потенциальные проблемы до их влияния на клиентов.
  • Участвовать в расследовании инцидентов, ошибок и деградаций, определять первопричины и координировать их устранение.
  • Анализировать повторяющиеся проблемы и инициировать изменения, предотвращающие их повторное возникновение.
  • Участвовать в postmortem и улучшении эксплуатационных процессов.
  • Автоматизировать рутинные операции и снижать объём ручной работы.
  • Участвовать в определении и контроле SLI/SLO для закреплённых сервисов.
  • Оценивать влияние технических проблем на доступность, производительность и основные пользовательские функции сервисов.
  • Взаимодействовать с разработчиками на всём жизненном цикле сервиса: от подготовки production до устранения эксплуатационных проблем.

Какие навыки для нас важны:

  • Высшее техническое образование (ИТ, вычислительная техника, автоматизация, телекоммуникации или смежные направления).
  • Опыт работы от 3–5 лет в эксплуатации, SRE, DevOps, Platform Engineering или близких направлениях. Желателен опыт сопровождения высоконагруженных или критичных production-сервисов.

Знания и навыки:

  • Linux на уровне продвинутого администратора/инженера.
  • Kubernetes.
  • Helm.
  • CI/CD и принципы автоматизированного deployment.
  • Мониторинг и observability: метрики, логи, алертинг.
  • Понимание принципов отказоустойчивости и эксплуатации production-систем.
  • Навыки диагностики проблем и анализа первопричин.
  • Git.
  • Умение работать с API, CLI и shell/python-скриптами.
  • Понимание сетевого взаимодействия и основных инфраструктурных компонентов.
  • Готовность глубоко разбираться в устройстве закреплённых сервисов.
  • Практический опыт SRE-подхода: SLI/SLO, error budget, incident/problem management.
  • Опыт эксплуатации OpenStack или других облачных платформ.
  • Prometheus, Grafana, Loki/ELK/OpenSearch или аналогичные системы.
  • Опыт работы с PostgreSQL, Redis, Kafka/RabbitMQ или другими распределёнными компонентами.
  • Опыт построения и улучшения production-инфраструктуры.
  • Опыт performance/capacity анализа.
  • Опыт автоматизации рутинных операций.
  • Знание принципов release engineering и безопасного rollout.
  • Опыт взаимодействия с командами разработки.

Требования к личным качествам:

  • Высокая ответственность за результат и production.
  • Системное мышление.
  • Умение самостоятельно расследовать незнакомые проблемы.
  • Техническая любознательность и готовность глубоко разбираться в работе сервисов.
  • Проактивность: способность выявлять проблемы до появления обращений от клиентов.
  • Умение конструктивно взаимодействовать с разработчиками и инфраструктурными командами.
  • Способность доводить проблему от обнаружения до устранения первопричины.
  • Способность работать самостоятельно и принимать технические решения.
  • Знание иностранного языка: Английский — чтение технической документации, понимание issue/troubleshooting материалов; B1–B2 и выше.

    Знание стека: Kubernetes, Helm, Linux, Git, CI/CD, Prometheus, Grafana, Docker, REST/API, сетевые технологии, системы логирования и мониторинга. Желательно OpenStack и связанные cloud-инфраструктурные технологии.

    Профессиональные навыки:

  • Deployment и сопровождение сервисов в production.
  • Разработка и поддержка Helm charts.
  • Помощь командам разработки при подготовке и выводе сервисов в production.
  • Настройка production-инфраструктуры и необходимых инфраструктурных компонентов.
  • Подготовка необходимых доступов и взаимодействие с ответственными инфраструктурными командами.
  • Настройка мониторинга, метрик, логирования и алертинга.
  • Контроль production-состояния и раннее выявление деградаций.
  • Анализ incidents и системных ошибок.
  • Поиск root cause и организация устранения проблем.
  • Участие в postmortem и предотвращении повторения инцидентов.
  • Повышение отказоустойчивости и наблюдаемости сервисов.
  • Автоматизация эксплуатационных операций и снижение ручного труда.
  • Участие в определении и контроле SLI/SLO для закреплённых сервисов.
  • Анализ влияния технических проблем на пользовательский опыт и работоспособность основных функций сервиса.
  • Взаимодействие с разработкой на всём жизненном цикле сервиса.

​​​​​​​​​​​​​​Специализированные программы: Kubernetes, Helm, GitLab/GitHub или аналогичные CI/CD-системы, Prometheus, Grafana, системы централизованного логирования, Linux CLI, Terraform/Ansible или аналоги

Похожие вакансии

Менеджер дистанционных продаж среднему и крупному бизнесу
Т-Банк
Зарплата не указана
Полная занятостьОпыт 1–3 года
Специалист входящих онлайн заявок
Центр занятости ФОРУМ
30000 – 45000 руб.
Полная занятостьОпыт не требуется
Персональный ассистент
huntIQ
Зарплата не указана
Полная занятостьОпыт 3–6 лет
Инженер-сметчик
Техпроект-Б
30000 – 60000 руб.
Полная занятостьОпыт 3–6 лет
Менеджер Wildberries — удалённая работа
БОР-М
50000 – 70000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по развитию ключевых клиентов / Customer Success Manager
Data Light
150000 – 200000 руб.
Полная занятостьОпыт 3–6 лет