DevOps Engineer/SRE

Мячков Эдуард Евгеньевич
Москва •Опубликовано 2 октября 2026
250000 – 300000 руб.
Полная занятость3–6 летПрограммист
250000 – 300000 руб.

Описание

Веду подбор ведущего DevOps-инженера для компании под NDA. Компания развивает инфраструктуру цифровых сервисов для финансовых и телекоммуникационных проектов, платформ обработки данных, ML/LLM-сервисов и корпоративных систем. Кандидат будет отвечать за промышленную эксплуатацию, автоматизацию поставки изменений и надёжность сервисов.

Обязанности:

  • Проектировать и развивать инфраструктуру в облаках и on-premise, поддерживать self-hosted сервисы, физические серверы, виртуальные машины и отказоустойчивые распределённые системы.
  • Администрировать Linux и Windows Server, эксплуатировать Kubernetes и контейнерные приложения: развёртывание, обновление, Helm-чарты, диагностика и масштабирование.
  • Создавать и поддерживать CI/CD-пайплайны: сборка, тестирование, доставка артефактов, развёртывание и откат. Развивать GitOps, применять blue-green и canary-релизы.
  • Описывать инфраструктуру как код, автоматизировать конфигурацию и регламентные операции, писать скрипты и внутренние инструменты, сокращать объём ручной работы.
  • Настраивать мониторинг, алерты, дашборды, централизованный сбор логов и распределённую трассировку; повышать качество сигналов и снижать шум алертов.
  • Определять и контролировать SLI, SLO, SLA и error budget. Измерять доступность, задержки, нагрузку, время восстановления и результаты изменений.
  • Диагностировать production-инциденты, восстанавливать сервисы, проводить RCA и postmortem, устранять первопричины и предотвращать повторные аварии.
  • Оптимизировать производительность и стоимость инфраструктуры, выполнять профилирование, capacity planning и планирование масштабирования.
  • Настраивать сети, маршрутизацию, DNS, TLS, балансировку, Ingress, VPN и Service Mesh; диагностировать прохождение трафика.
  • Сопровождать базы данных, кэши, очереди и платформы данных: репликация, отказоустойчивость, настройка производительности и устранение сбоев.
  • Организовывать backup/restore и disaster recovery, регулярно проверять восстановление и достижение целевых RPO и RTO.
  • Проводить миграции и обновления сервисов и платформ с проверкой совместимости, планом отката и контролем простоя.
  • Управлять доступами, сертификатами и секретами, выполнять hardening, внедрять проверки безопасности в CI/CD и участвовать в аудитах инфраструктуры.
  • Развивать MLOps, GPU- и LLM-инфраструктуру, сопровождать развёртывание моделей.
  • Работать с разработкой, QA, Data/ML-командами и информационной безопасностью, развивать platform engineering, объяснять технические риски и согласовывать изменения.
  • Вести документацию архитектуры, серверов, IP-адресов и связей сервисов, runbooks и инструкции. Участвовать в код-ревью, наставничестве и передаче знаний.
  • Участвовать в оплачиваемых дежурствах on-call, включая внерабочее время, для круглосуточного реагирования на критические инциденты.

Требования:

  • Более 5 лет опыта в DevOps, SRE или инфраструктурной инженерии. Практический опыт промышленной эксплуатации высоконагруженных и распределённых систем, самостоятельного сопровождения облачной и on-premise инфраструктуры.
  • Операционные системы: Ubuntu, Debian, RHEL/Red Hat/Rocky Linux, Astra Linux, AlmaLinux; Windows Server. Администрирование, обновление и диагностика серверов, анализ CPU, RAM и I/O.
  • Скриптинг: Bash, Python, Go, PowerShell; SQL. Умение читать код, собирать и диагностировать сервисы на Java, PHP, TypeScript.
  • Контейнеры: Docker, Kubernetes, Helm, OpenShift, K3s, RKE/RKE2 и Rancher. Эксплуатация кластеров и диагностика контейнерной среды.
  • Сборка и поставка: Git, GitLab, GitHub Actions,. Работа с Nexus, JFrog Artifactory, Maven и Gradle; разработка и оптимизация пайплайнов.
  • GitOps и релизы: Argo CD и Argo Workflows, blue-green и canary-развёртывания.
  • Инфраструктура как код (IaC): Terraform (OpenTofu), Terragrunt, Ansible.
  • Облачные платформы: AWS, Google Cloud/GCP, Yandex Cloud, Selectel. Управление ресурсами, VPC, сетями, IAM и managed-сервисами, сопровождение инфраструктуры через код.
  • Серверы и виртуализация: bare metal, VMware ESXi/vSphere, Proxmox.
  • Хранилища: MinIO, Ceph, Longhorn, LVM и RAID. Настройка, диагностика и обеспечение сохранности данных.
  • Мониторинг и алерты: Grafana, VictoriaMetrics, Alertmanager, Datadog, Thanos; проектирование дашбордов и правил оповещения.
  • Логи и трассировка: ELK/OpenSearch, Loki, Kibana, Vector и Promtail; OpenTelemetry, Tempo и Sentry.
  • Сети: TCP/IP, DNS, HTTP/HTTPS, NAT, BGP, VPN, WireGuard, iptables и nftables; Nginx, HAProxy, Envoy, Ingress, Keepalived. Service Mesh, Istio, Cilium; диагностика сетевого взаимодействия.
  • Доступы и секреты: HashiCorp Vault, Keycloak, FreeIPA. Управление сертификатами и безопасностью сервисных взаимодействий.
  • Безопасность: WAF и SIEM, SAST, DAST, SCA, SBOM, SonarQube и Trivy.
  • Базы данных и кэши: PostgreSQL (Patroni), Redis и etcd. Репликация, backup/restore.
  • Очереди: Kafka, RabbitMQ, Airflow.
  • MLOps и AI-инфраструктура: MLflow, Kubeflow, KServe и Seldon; эксплуатация LLM, VLM и RAG-сервисов, self-hosted inference на vLLM и Ollama. Работа с NVIDIA GPU, CUDA и GPU-нодами Kubernetes, MIG/MPS.
  • Практики SRE: SLI, SLO, SLA, error budget, MTTR, RPO и RTO. Умение использовать показатели для оценки надёжности, нагрузки и результата изменений.
  • Опыт работы в банковских или финансовых системах с требованиями информационной безопасности и аудита.
  • Высшее техническое образование. Английский язык от B1 для чтения документации и профессионального общения.

Условия:

  • Полная занятость, трудоустройство в штат компании-работодателя по ТК РФ, оплачиваемые отпуск и больничные.
  • Удалённая работа с территории России. График 5/2, с гибким началом дня c 8:00 до 12:00 по GMT+3.
  • Дежурства on-call по заранее согласованной ротации, отдельно оплачиваются.
  • Компания предоставляет рабочее оборудование (MacOS, Windows, Linux), ДМС после испытательного срока и бюджет на профильное обучение и сертификации.
  • Участие в выборе технических решений и развитии инфраструктуры, работа с инженерными командами и обмен знаниями.
  • Премии по результатам работы.

Linux, Kubernetes, Docker, Helm, CI/CD, GitLab CI, Git, Ansible, Terraform, Python, Bash, Prometheus, Grafana, VictoriaMetrics, GitOps, Argo CD, PostgreSQL, Redis, Kafka, SQL, Nginx, Vault, AWS, SRE, SLI/SLO/SLA, Высокая доступность, Управление инцидентами, MLOps, GPU/CUDA

Описание

Веду подбор ведущего DevOps-инженера для компании под NDA. Компания развивает инфраструктуру цифровых сервисов для финансовых и телекоммуникационных проектов, платформ обработки данных, ML/LLM-сервисов и корпоративных систем. Кандидат будет отвечать за промышленную эксплуатацию, автоматизацию поставки изменений и надёжность сервисов.

Обязанности:

  • Проектировать и развивать инфраструктуру в облаках и on-premise, поддерживать self-hosted сервисы, физические серверы, виртуальные машины и отказоустойчивые распределённые системы.
  • Администрировать Linux и Windows Server, эксплуатировать Kubernetes и контейнерные приложения: развёртывание, обновление, Helm-чарты, диагностика и масштабирование.
  • Создавать и поддерживать CI/CD-пайплайны: сборка, тестирование, доставка артефактов, развёртывание и откат. Развивать GitOps, применять blue-green и canary-релизы.
  • Описывать инфраструктуру как код, автоматизировать конфигурацию и регламентные операции, писать скрипты и внутренние инструменты, сокращать объём ручной работы.
  • Настраивать мониторинг, алерты, дашборды, централизованный сбор логов и распределённую трассировку; повышать качество сигналов и снижать шум алертов.
  • Определять и контролировать SLI, SLO, SLA и error budget. Измерять доступность, задержки, нагрузку, время восстановления и результаты изменений.
  • Диагностировать production-инциденты, восстанавливать сервисы, проводить RCA и postmortem, устранять первопричины и предотвращать повторные аварии.
  • Оптимизировать производительность и стоимость инфраструктуры, выполнять профилирование, capacity planning и планирование масштабирования.
  • Настраивать сети, маршрутизацию, DNS, TLS, балансировку, Ingress, VPN и Service Mesh; диагностировать прохождение трафика.
  • Сопровождать базы данных, кэши, очереди и платформы данных: репликация, отказоустойчивость, настройка производительности и устранение сбоев.
  • Организовывать backup/restore и disaster recovery, регулярно проверять восстановление и достижение целевых RPO и RTO.
  • Проводить миграции и обновления сервисов и платформ с проверкой совместимости, планом отката и контролем простоя.
  • Управлять доступами, сертификатами и секретами, выполнять hardening, внедрять проверки безопасности в CI/CD и участвовать в аудитах инфраструктуры.
  • Развивать MLOps, GPU- и LLM-инфраструктуру, сопровождать развёртывание моделей.
  • Работать с разработкой, QA, Data/ML-командами и информационной безопасностью, развивать platform engineering, объяснять технические риски и согласовывать изменения.
  • Вести документацию архитектуры, серверов, IP-адресов и связей сервисов, runbooks и инструкции. Участвовать в код-ревью, наставничестве и передаче знаний.
  • Участвовать в оплачиваемых дежурствах on-call, включая внерабочее время, для круглосуточного реагирования на критические инциденты.

Требования:

  • Более 5 лет опыта в DevOps, SRE или инфраструктурной инженерии. Практический опыт промышленной эксплуатации высоконагруженных и распределённых систем, самостоятельного сопровождения облачной и on-premise инфраструктуры.
  • Операционные системы: Ubuntu, Debian, RHEL/Red Hat/Rocky Linux, Astra Linux, AlmaLinux; Windows Server. Администрирование, обновление и диагностика серверов, анализ CPU, RAM и I/O.
  • Скриптинг: Bash, Python, Go, PowerShell; SQL. Умение читать код, собирать и диагностировать сервисы на Java, PHP, TypeScript.
  • Контейнеры: Docker, Kubernetes, Helm, OpenShift, K3s, RKE/RKE2 и Rancher. Эксплуатация кластеров и диагностика контейнерной среды.
  • Сборка и поставка: Git, GitLab, GitHub Actions,. Работа с Nexus, JFrog Artifactory, Maven и Gradle; разработка и оптимизация пайплайнов.
  • GitOps и релизы: Argo CD и Argo Workflows, blue-green и canary-развёртывания.
  • Инфраструктура как код (IaC): Terraform (OpenTofu), Terragrunt, Ansible.
  • Облачные платформы: AWS, Google Cloud/GCP, Yandex Cloud, Selectel. Управление ресурсами, VPC, сетями, IAM и managed-сервисами, сопровождение инфраструктуры через код.
  • Серверы и виртуализация: bare metal, VMware ESXi/vSphere, Proxmox.
  • Хранилища: MinIO, Ceph, Longhorn, LVM и RAID. Настройка, диагностика и обеспечение сохранности данных.
  • Мониторинг и алерты: Grafana, VictoriaMetrics, Alertmanager, Datadog, Thanos; проектирование дашбордов и правил оповещения.
  • Логи и трассировка: ELK/OpenSearch, Loki, Kibana, Vector и Promtail; OpenTelemetry, Tempo и Sentry.
  • Сети: TCP/IP, DNS, HTTP/HTTPS, NAT, BGP, VPN, WireGuard, iptables и nftables; Nginx, HAProxy, Envoy, Ingress, Keepalived. Service Mesh, Istio, Cilium; диагностика сетевого взаимодействия.
  • Доступы и секреты: HashiCorp Vault, Keycloak, FreeIPA. Управление сертификатами и безопасностью сервисных взаимодействий.
  • Безопасность: WAF и SIEM, SAST, DAST, SCA, SBOM, SonarQube и Trivy.
  • Базы данных и кэши: PostgreSQL (Patroni), Redis и etcd. Репликация, backup/restore.
  • Очереди: Kafka, RabbitMQ, Airflow.
  • MLOps и AI-инфраструктура: MLflow, Kubeflow, KServe и Seldon; эксплуатация LLM, VLM и RAG-сервисов, self-hosted inference на vLLM и Ollama. Работа с NVIDIA GPU, CUDA и GPU-нодами Kubernetes, MIG/MPS.
  • Практики SRE: SLI, SLO, SLA, error budget, MTTR, RPO и RTO. Умение использовать показатели для оценки надёжности, нагрузки и результата изменений.
  • Опыт работы в банковских или финансовых системах с требованиями информационной безопасности и аудита.
  • Высшее техническое образование. Английский язык от B1 для чтения документации и профессионального общения.

Условия:

  • Полная занятость, трудоустройство в штат компании-работодателя по ТК РФ, оплачиваемые отпуск и больничные.
  • Удалённая работа с территории России. График 5/2, с гибким началом дня c 8:00 до 12:00 по GMT+3.
  • Дежурства on-call по заранее согласованной ротации, отдельно оплачиваются.
  • Компания предоставляет рабочее оборудование (MacOS, Windows, Linux), ДМС после испытательного срока и бюджет на профильное обучение и сертификации.
  • Участие в выборе технических решений и развитии инфраструктуры, работа с инженерными командами и обмен знаниями.
  • Премии по результатам работы.

Linux, Kubernetes, Docker, Helm, CI/CD, GitLab CI, Git, Ansible, Terraform, Python, Bash, Prometheus, Grafana, VictoriaMetrics, GitOps, Argo CD, PostgreSQL, Redis, Kafka, SQL, Nginx, Vault, AWS, SRE, SLI/SLO/SLA, Высокая доступность, Управление инцидентами, MLOps, GPU/CUDA

Похожие вакансии

Дизайнер по обработке фотографий
Гасанов Руслан Абидипович
от 50000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по обработке заявок
ЕЦТ
до 70000 руб.
Полная занятостьОпыт не требуется
Дизайнер рекламных креативов
ПЕРСОНАЛ
Зарплата не указана
Полная занятостьОпыт 1–3 года
Менеджер по продажам в онлайн-школу
Егорова Дарья Ивановна
от 130000 руб.
Полная занятостьОпыт 1–3 года
Визовый специалист
Голубицкая Алёна Дмитриевна
60000 – 250000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по логистике
Волкова Елена Сергеевна
от 70000 руб.
Полная занятостьОпыт не требуется