Мячков Эдуард Евгеньевич

BtlРазмер не указан

О компании

Описание компании пока не заполнено.

Город: Москва

Открытые вакансии (1)

Мячков Эдуард Евгеньевич DevOps Engineer/SRE
250 000 – 300 000 ₽Москва
ПрограммистУдалённая работа3–6 лет
Веду подбор ведущего DevOps-инженера для компании под NDA. Компания развивает инфраструктуру цифровых сервисов для финансовых и телекоммуникационных проектов, платформ обработки данных, ML/LLM-сервисов и корпоративных систем. Кандидат будет отвечать за промышленную эксплуатацию, автоматизацию поставки изменений и надёжность сервисов. Обязанности: Проектировать и развивать инфраструктуру в облаках и on-premise, поддерживать self-hosted сервисы, физические серверы, виртуальные машины и отказоустойчивые распределённые системы. Администрировать Linux и Windows Server, эксплуатировать Kubernetes и контейнерные приложения: развёртывание, обновление, Helm-чарты, диагностика и масштабирование. Создавать и поддерживать CI/CD-пайплайны: сборка, тестирование, доставка артефактов, развёртывание и откат. Развивать GitOps, применять blue-green и canary-релизы. Описывать инфраструктуру как код, автоматизировать конфигурацию и регламентные операции, писать скрипты и внутренние инструменты, сокращать объём ручной работы. Настраивать мониторинг, алерты, дашборды, централизованный сбор логов и распределённую трассировку; повышать качество сигналов и снижать шум алертов. Определять и контролировать SLI, SLO, SLA и error budget. Измерять доступность, задержки, нагрузку, время восстановления и результаты изменений. Диагностировать production-инциденты, восстанавливать сервисы, проводить RCA и postmortem, устранять первопричины и предотвращать повторные аварии. Оптимизировать производительность и стоимость инфраструктуры, выполнять профилирование, capacity planning и планирование масштабирования. Настраивать сети, маршрутизацию, DNS, TLS, балансировку, Ingress, VPN и Service Mesh; диагностировать прохождение трафика. Сопровождать базы данных, кэши, очереди и платформы данных: репликация, отказоустойчивость, настройка производительности и устранение сбоев. Организовывать backup/restore и disaster recovery, регулярно проверять восстановление и достижение целевых RPO и RTO. Проводить миграции и обновления сервисов и платформ с проверкой совместимости, планом отката и контролем простоя. Управлять доступами, сертификатами и секретами, выполнять hardening, внедрять проверки безопасности в CI/CD и участвовать в аудитах инфраструктуры. Развивать MLOps, GPU- и LLM-инфраструктуру, сопровождать развёртывание моделей. Работать с разработкой, QA, Data/ML-командами и информационной безопасностью, развивать platform engineering, объяснять технические риски и согласовывать изменения. Вести документацию архитектуры, серверов, IP-адресов и связей сервисов, runbooks и инструкции. Участвовать в код-ревью, наставничестве и передаче знаний. Участвовать в оплачиваемых дежурствах on-call, включая внерабочее время, для круглосуточного реагирования на критические инциденты. Требования: Более 5 лет опыта в DevOps, SRE или инфраструктурной инженерии. Практический опыт промышленной эксплуатации высоконагруженных и распределённых систем, самостоятельного сопровождения облачной и on-premise инфраструктуры. Операционные системы: Ubuntu, Debian, RHEL/Red Hat/Rocky Linux, Astra Linux, AlmaLinux; Windows Server. Администрирование, обновление и диагностика серверов, анализ CPU, RAM и I/O. Скриптинг: Bash, Python, Go, PowerShell; SQL. Умение читать код, собирать и диагностировать сервисы на Java, PHP, TypeScript. Контейнеры: Docker, Kubernetes, Helm, OpenShift, K3s, RKE/RKE2 и Rancher. Эксплуатация кластеров и диагностика контейнерной среды. Сборка и поставка: Git, GitLab, GitHub Actions,. Работа с Nexus, JFrog Artifactory, Maven и Gradle; разработка и оптимизация пайплайнов. GitOps и релизы: Argo CD и Argo Workflows, blue-green и canary-развёртывания. Инфраструктура как код (IaC): Terraform (OpenTofu), Terragrunt, Ansible. Облачные платформы: AWS, Google Cloud/GCP, Yandex Cloud, Selectel. Управление ресурсами, VPC, сетями, IAM и managed-сервисами, сопровождение инфраструктуры через код. Серверы и виртуализация: bare metal, VMware ESXi/vSphere, Proxmox. Хранилища: MinIO, Ceph, Longhorn, LVM и RAID. Настройка, диагностика и обеспечение сохранности данных. Мониторинг и алерты: Grafana, VictoriaMetrics, Alertmanager, Datadog, Thanos; проектирование дашбордов и правил оповещения. Логи и трассировка: ELK/OpenSearch, Loki, Kibana, Vector и Promtail; OpenTelemetry, Tempo и Sentry. Сети: TCP/IP, DNS, HTTP/HTTPS, NAT, BGP, VPN, WireGuard, iptables и nftables; Nginx, HAProxy, Envoy, Ingress, Keepalived. Service Mesh, Istio, Cilium; диагностика сетевого взаимодействия. Доступы и секреты: HashiCorp Vault, Keycloak, FreeIPA. Управление сертификатами и безопасностью сервисных взаимодействий. Безопасность: WAF и SIEM, SAST, DAST, SCA, SBOM, SonarQube и Trivy. Базы данных и кэши: PostgreSQL (Patroni), Redis и etcd. Репликация, backup/restore. Очереди: Kafka, RabbitMQ, Airflow. MLOps и AI-инфраструктура: MLflow, Kubeflow, KServe и Seldon; эксплуатация LLM, VLM и RAG-сервисов, self-hosted inference на vLLM и Ollama. Работа с NVIDIA GPU, CUDA и GPU-нодами Kubernetes, MIG/MPS. Практики SRE: SLI, SLO, SLA, error budget, MTTR, RPO и RTO. Умение использовать показатели для оценки надёжности, нагрузки и результата изменений. Опыт работы в банковских или финансовых системах с требованиями информационной безопасности и аудита. Высшее техническое образование. Английский язык от B1 для чтения документации и профессионального общения. Условия: Полная занятость, трудоустройство в штат компании-работодателя по ТК РФ, оплачиваемые отпуск и больничные. Удалённая работа с территории России. График 5/2, с гибким началом дня c 8:00 до 12:00 по GMT+3. Дежурства on-call по заранее согласованной ротации, отдельно оплачиваются. Компания предоставляет рабочее оборудование (MacOS, Windows, Linux), ДМС после испытательного срока и бюджет на профильное обучение и сертификации. Участие в выборе технических решений и развитии инфраструктуры, работа с инженерными командами и обмен знаниями. Премии по результатам работы. Linux, Kubernetes, Docker, Helm, CI/CD, GitLab CI, Git, Ansible, Terraform, Python, Bash, Prometheus, Grafana, VictoriaMetrics, GitOps, Argo CD, PostgreSQL, Redis, Kafka, SQL, Nginx, Vault, AWS, SRE, SLI/SLO/SLA, Высокая доступность, Управление инцидентами, MLOps, GPU/CUDA