DevOps-инженер

ВСК, САО
Москва •Опубликовано 2 октября 2026
Зарплата не указана
Полная занятость3–6 летПрограммист
Зарплата не указана

Описание

О проекте: Ищем DevOps-инженера, который возьмет на себя полную ответственность за надежность, доступность и отказоустойчивость сервисов в production-среде в соответствии со стандартами SLA/SLO. В ключевые задачи войдут развитие современной системы observability (метрики, логи, трейсы), участие в оперативных дежурствах, а также глубокое расследование инцидентов с поиском их первопричин и фиксацией опыта в постмортемах для защиты от повторных аварий.

Стек: CI/CD и автоматизация: Jenkins, GitLab CI, Ansible
Контроль версий и качество кода: Git, SonarQube, Nexus
Сборка: Maven, Gradle, NPM
Контейнеризация и оркестрация: Docker, Kubernetes/OpenShift, Docker Swarm
Service mesh: Istio
Данные и интеграции: PostgreSQL, Kafka, Redis
BPM/workflow: Camunda
ОС: Linux (Ubuntu/Debian)
Наблюдаемость: Prometheus, Grafana, Grafana Tempo, OpenTelemetry, Zabbix

Чем предстоит заниматься:

  • Поддерживать стабильность и доступность сервисов в production

  • Следить за состоянием сервисов в режиме реального времени, реагировать на инциденты и минимизировать время недоступности

  • Обеспечивать соответствие SLA/SLO, участвовать в дежурствах (on-call)

  • Расследовать инциденты, находить root cause и устранять аварии

  • Быстро локализовать проблему, устранить её и зафиксировать в постмортеме, чтобы она не повторилась (анализировать цепочку событий, а не только симптомы)

  • Проектировать и развивать наблюдаемость (observability)

  • Развивать систему метрик, логов, трейсов, алертинга и дашбордов на базе Prometheus, Grafana, Grafana Tempo, OpenTelemetry и т.д

  • Улучшать существующие алерты, убирать шум, закрывать «слепые пятна» в мониторинге

  • Помогать командам разработки и эксплуатации

  • Выступать точкой экспертизы при расследовании нештатных ситуаций: помогать читать логи, интерпретировать метрики, находить узкие места

  • Работать на стыке команд, чтобы проблемы решались быстрее и системнее

Что мы ждем:

  • Linux (Ubuntu/Debian) на уровне администратора
  • Понимание сетей: TCP/IP, маршрутизация, DNS, NAT, SSL/CORS
  • Опыт работы с веб-серверами и балансировщиками: Nginx, HAProxy
  • Ansible: роли, шаблоны, inventory, идемпотентность
  • Docker / Docker Compose в production
  • Понимание сборки образов и оркестрации (Swarm/Kubernetes)
  • Уверенный Bash (чтение чужого и написание своего)
Описание

О проекте: Ищем DevOps-инженера, который возьмет на себя полную ответственность за надежность, доступность и отказоустойчивость сервисов в production-среде в соответствии со стандартами SLA/SLO. В ключевые задачи войдут развитие современной системы observability (метрики, логи, трейсы), участие в оперативных дежурствах, а также глубокое расследование инцидентов с поиском их первопричин и фиксацией опыта в постмортемах для защиты от повторных аварий.

Стек: CI/CD и автоматизация: Jenkins, GitLab CI, Ansible
Контроль версий и качество кода: Git, SonarQube, Nexus
Сборка: Maven, Gradle, NPM
Контейнеризация и оркестрация: Docker, Kubernetes/OpenShift, Docker Swarm
Service mesh: Istio
Данные и интеграции: PostgreSQL, Kafka, Redis
BPM/workflow: Camunda
ОС: Linux (Ubuntu/Debian)
Наблюдаемость: Prometheus, Grafana, Grafana Tempo, OpenTelemetry, Zabbix

Чем предстоит заниматься:

  • Поддерживать стабильность и доступность сервисов в production

  • Следить за состоянием сервисов в режиме реального времени, реагировать на инциденты и минимизировать время недоступности

  • Обеспечивать соответствие SLA/SLO, участвовать в дежурствах (on-call)

  • Расследовать инциденты, находить root cause и устранять аварии

  • Быстро локализовать проблему, устранить её и зафиксировать в постмортеме, чтобы она не повторилась (анализировать цепочку событий, а не только симптомы)

  • Проектировать и развивать наблюдаемость (observability)

  • Развивать систему метрик, логов, трейсов, алертинга и дашбордов на базе Prometheus, Grafana, Grafana Tempo, OpenTelemetry и т.д

  • Улучшать существующие алерты, убирать шум, закрывать «слепые пятна» в мониторинге

  • Помогать командам разработки и эксплуатации

  • Выступать точкой экспертизы при расследовании нештатных ситуаций: помогать читать логи, интерпретировать метрики, находить узкие места

  • Работать на стыке команд, чтобы проблемы решались быстрее и системнее

Что мы ждем:

  • Linux (Ubuntu/Debian) на уровне администратора
  • Понимание сетей: TCP/IP, маршрутизация, DNS, NAT, SSL/CORS
  • Опыт работы с веб-серверами и балансировщиками: Nginx, HAProxy
  • Ansible: роли, шаблоны, inventory, идемпотентность
  • Docker / Docker Compose в production
  • Понимание сборки образов и оркестрации (Swarm/Kubernetes)
  • Уверенный Bash (чтение чужого и написание своего)

Похожие вакансии

Координатор производства детских AI-книг
SunRoom - браслеты из натуральных камней
50000 – 70000 руб.
Полная занятостьОпыт 1–3 года
Product manager
ФЕНСИ ТЕК ГРУП
до 300000 руб.
Полная занятостьОпыт 3–6 лет
Менеджер Wildberries — удалённая работа
БОР-М
50000 – 70000 руб.
Полная занятостьОпыт 1–3 года
Учитель английского языка
Онлайн школа Матикс
69000 – 92000 руб.
Полная занятостьОпыт 1–3 года
AI-креатор (фото и видео)
Профессиональные Люди
150000 – 300000 руб.
Полная занятостьОпыт не требуется
Менеджер по продажам в онлайн-школу
Егорова Дарья Ивановна
от 130000 руб.
Полная занятостьОпыт 1–3 года