DevOps AI specialist

LIFE PAY
Москва Опубликовано 17 августа 2026
Зарплата не указана
Полная занятостьболее 6 летПрограммист
Зарплата не указана

Описание

Привет!

Сейчас мы активно развиваем новые направления. У тебя будет возможность войти в core-команду финтех-продукта на самом старте и вместе с ИИ-агентами развивать инфраструктуру.

Чем будем заниматься:
  • CI/CD. Построение и сопровождение пайплайнов непрерывной интеграции и доставки (GitHub Actions / GitLab CI), автоматизация сборки, тестирования и деплоя с быстрым откатом;

  • Infrastructure as Code. Описание и версионирование инфраструктуры через Terraform/Pulumi, GitOps-подход, стандартизация окружений dev/staging/prod;

  • Контейнеризация и оркестрация. Управление Docker и Kubernetes, настройка кластеров, networking и ресурсных лимитов;

  • Observability. Настройка мониторинга, логирования и алертинга (Prometheus, Grafana, ELK/Loki, OpenTelemetry), построение дашбордов и распределённого трейсинга;

  • Надёжность и SRE. Определение и поддержка SLA/SLO/SLI, инцидент-менеджмент, postmortem-практики, дежурства on-call, capacity planning;

  • Инфраструктура AI-агентов. Развёртывание и поддержка среды для запуска агентов и агентных циклов (agent loops): оркестрация воркфлоу, управление очередями задач и пулами воркеров;

  • LLM-инфраструктура. Управление model serving, API-шлюзами, балансировкой, rate limiting и фоллбэками;
    роутинг между моделями и провайдерами для отказоустойчивости;

  • Observability агентных циклов. Трассировка вызовов инструментов (tools), метрики числа итераций, латентности, расхода токенов и success rate; защита от «зацикливания» и runaway-процессов;

  • FinOps. Контроль и оптимизация затрат на облако и LLM-API, бюджетирование токенов и ресурсов, алерты по аномальному потреблению;

  • Безопасность и автоматизация. Управление секретами и ключами (Vault), RBAC, sandboxing исполнения агентов, изоляция данных, автоматизация рутинных операций.

Что для этого от тебя необходимо:
  • AWS или Яндекс Облако: опыт от 3 лет;
  • Глубокое понимание distributed systems и failure modes;
  • Advanced observability: metrics, logs, traces, correlation model;
  • Capacity planning, performance и degradation analysis;
  • Recovery / DR / failover design;
  • Понимание cloud / platform failure domains и межсистемных зависимостей;
  • Graceful degradation, load shedding, backpressure, retry budgets, idempotency;
  • Blameless postmortem с контролем corrective actions;
  • Chaos-informed thinking, gamedays и failure injection;
  • Проведение incident review и post-mortem;
  • Проактивность и самостоятельность — готовность действовать без тикетов на каждый шаг;
  • Умение считать стоимость инфраструктуры и принимать решения с оглядкой на cost.
Что предлагаем:
  • Полностью удаленный формат работы с гибким началом рабочего дня, рассматриваем кандидатов вне РФ;
  • Стек без legacy: AWS, Kubernetes, GitLab CI/CD, Grafana + Prometheus, IaC;
  • Открытая корпоративная культура, общение на ты, поддержка инициатив;
  • Работа в технологической компании, которая создаёт сервисы, приносящие пользу миллионам людей;
  • Бенефиты и плюшки для сотрудников.
Описание
Привет!

Сейчас мы активно развиваем новые направления. У тебя будет возможность войти в core-команду финтех-продукта на самом старте и вместе с ИИ-агентами развивать инфраструктуру.

Чем будем заниматься:
  • CI/CD. Построение и сопровождение пайплайнов непрерывной интеграции и доставки (GitHub Actions / GitLab CI), автоматизация сборки, тестирования и деплоя с быстрым откатом;

  • Infrastructure as Code. Описание и версионирование инфраструктуры через Terraform/Pulumi, GitOps-подход, стандартизация окружений dev/staging/prod;

  • Контейнеризация и оркестрация. Управление Docker и Kubernetes, настройка кластеров, networking и ресурсных лимитов;

  • Observability. Настройка мониторинга, логирования и алертинга (Prometheus, Grafana, ELK/Loki, OpenTelemetry), построение дашбордов и распределённого трейсинга;

  • Надёжность и SRE. Определение и поддержка SLA/SLO/SLI, инцидент-менеджмент, postmortem-практики, дежурства on-call, capacity planning;

  • Инфраструктура AI-агентов. Развёртывание и поддержка среды для запуска агентов и агентных циклов (agent loops): оркестрация воркфлоу, управление очередями задач и пулами воркеров;

  • LLM-инфраструктура. Управление model serving, API-шлюзами, балансировкой, rate limiting и фоллбэками;
    роутинг между моделями и провайдерами для отказоустойчивости;

  • Observability агентных циклов. Трассировка вызовов инструментов (tools), метрики числа итераций, латентности, расхода токенов и success rate; защита от «зацикливания» и runaway-процессов;

  • FinOps. Контроль и оптимизация затрат на облако и LLM-API, бюджетирование токенов и ресурсов, алерты по аномальному потреблению;

  • Безопасность и автоматизация. Управление секретами и ключами (Vault), RBAC, sandboxing исполнения агентов, изоляция данных, автоматизация рутинных операций.

Что для этого от тебя необходимо:
  • AWS или Яндекс Облако: опыт от 3 лет;
  • Глубокое понимание distributed systems и failure modes;
  • Advanced observability: metrics, logs, traces, correlation model;
  • Capacity planning, performance и degradation analysis;
  • Recovery / DR / failover design;
  • Понимание cloud / platform failure domains и межсистемных зависимостей;
  • Graceful degradation, load shedding, backpressure, retry budgets, idempotency;
  • Blameless postmortem с контролем corrective actions;
  • Chaos-informed thinking, gamedays и failure injection;
  • Проведение incident review и post-mortem;
  • Проактивность и самостоятельность — готовность действовать без тикетов на каждый шаг;
  • Умение считать стоимость инфраструктуры и принимать решения с оглядкой на cost.
Что предлагаем:
  • Полностью удаленный формат работы с гибким началом рабочего дня, рассматриваем кандидатов вне РФ;
  • Стек без legacy: AWS, Kubernetes, GitLab CI/CD, Grafana + Prometheus, IaC;
  • Открытая корпоративная культура, общение на ты, поддержка инициатив;
  • Работа в технологической компании, которая создаёт сервисы, приносящие пользу миллионам людей;
  • Бенефиты и плюшки для сотрудников.

Похожие вакансии

Ведущий специалист по кадровому учету
Бридж Групп
от 70000 руб.
Полная занятостьОпыт 3–6 лет
Frontend Developer (Angular)
Andersen
Зарплата не указана
Полная занятостьОпыт 3–6 лет
Специалист отдела кадров
БрикСайд
от 2000
Полная занятостьОпыт 1–3 года
Менеджер по продажам
Эстетика
150000 – 200000 руб.
Полная занятостьОпыт 1–3 года
Маркетолог в онлайн-проект
Турлаева Надежда Николаевна
от 100000 руб.
Полная занятостьОпыт 1–3 года
Системный администратор (удаленно)
МитМил
Зарплата не указана
Полная занятостьОпыт 1–3 года