SRE инженер

ТехВилл
Москва •Опубликовано 20 августа 2026
200000 – 442200 руб.
Полная занятость3–6 летПрограммист
200000 – 442200 руб.

Описание

ТехВилл – IT-компания и партнёр ВкусВилл по развитию цифровых решений.

Мы отвечаем за разработку мобильных и web- приложений, автоматизацию бизнес-процессов, искусственный интеллект, devops, инфобез ВкусВилла.

Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.

Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.

Обязанности:

  • Поддержка сервисов и команд разработки со стороны инфраструктуры;
  • Обеспечение надежности и масштабируемости систем;
  • Выявление и устранение узких мест в производительности;
  • Настройка систем мониторинга, логирования и трейсинга;
  • Предотвращение потенциальных сбоев;
  • Оптимизация CI/CD пайплайнов, внедрение инфраструктуры как код (IaC) и автоматизация рутинных задач;
  • Продвижение практик DevOps в сторону разработки: внедрение best practices DevOps, таких как мониторинг SLA, SLO, SLI, анализ инцидентов (postmortem) и управление изменениями;
  • Участие в создании и развитии инфраструктурных платформ;
  • Обеспечение безопасности, надежности, отказоустойчивости и быстрого восстановления после сбоев платформы.

Требования:

  • Практический опыт в администрировании и поддержки информационных систем семейства Linux (Debian, Ubuntu, Rocky);
  • Владение bash или python как инструментарием для автоматизации рутинной деятельности;
  • Практический опыт применения систем оркестрации контейнеров (Kubernetes, Docker compose);
  • Практический опыт работы с контейнерами (Docker), знание основ построения Dockerfile и лучших практик в этой области;
  • Владение системами управления конфигурациями (Ansible, Terraform, Pulumi) и практический опыт применения таких систем в процессах построения IaC (Infrastructure as Code;
  • Применение инструментов GitLab CI и Jenkins в построении процессов сборки и доставки;
  • Практический опыт применения и администрирования систем мониторинга на базе Prometheus, Zabbix, Grafana Stack, Alertmanager, VictoriaMetrics;
  • Практический опыт взаимодействия с системами потоковой передачи событий (Kafka, RabbitMQ);
  • Знание методологий Agile, опыт работы в тикетных системах (Yandex Tracker и др.) и системах хранения документации (Evawiki и другие Wiki);
  • Практический опыт эксплуатации веб-серверов и балансировщиков нагрузки (Nginx, HAProxy, Traefik, APISIX);
  • Практический опыт администрирования систем управления реляционными базами данных (PostgreSQL, Greenplum, MySQL), кластеризации на базе Patroni, а также колоночной СУБД ClickHouse;
  • Практический опыт применения NoSQL и Key-Value систем (Elasticsearch, OpenSearch, etcd, Redis, Memcached);
  • Практический опыт применения систем централизованного сбора и хранения логов на базе стеков: Logstash, Vector, Graylog, Loki;
  • Практический опыт применения систем объектного хранения на базе S3 (MinIO), а также инструментов доступа к ним;
  • Навыки работы с облачными системами (Yandex Cloud, Cloud.ru) и системами управления ими;
  • Практический опыт оркестрации пайплайнов обработки данных на базе Apache Airflow;
  • Опыт развертывания и сопровождения JupyterHub
  • Владение инструментарием распределённой обработки данных (Apache Spark, Spark Streaming);
  • Опыт работы с Iceberg REST Catalog как каталогом табличных данных;
  • Практический опыт применения MLflow для отслеживания экспериментов, регистрации моделей и управления их жизненным циклом;
  • Знакомство с векторными базами данных (Qdrant) в составе ML-платформы;
  • Знакомство с платформой автоматизации процессов на базе n8n;
  • Понимание/опыт развёртывания и эксплуатации LLM‑моделей на GPU (Triton Inference Server, vLLM, TensorRT‑LLM или аналоги);
  • Знание GPU‑мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink;
  • Опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV‑cache;
  • Управление ресурсами GPU в K8s: HAMi, MIG, time‑slicing, квотирование;
  • Понимание работы с NVDEC/NVENC;
  • Практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling → validation;
  • Опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами.

Условия:

  • Работу в аккредитованной IT-компании.
  • Удалённая работа: для нас важны результаты работы без привязки к месту;
  • Официальное оформление с первого дня работы и поддержка куратора во время адаптации.
  • Прозрачная система развития: понятные грейды, внутреннее и внешнее обучение, индивидуальные планы развития и матрицы компетенций.
  • Экологичная культура и адекватные руководители.
  • Компенсация затрат на медицинские услуги, ментальное благополучие, спорт, тимбилдинги и использование AI-помощников.
  • Бонус 15% с покупок во ВкусВилл.
  • Социальная ответственность: поощряем донорство, оказываем материальную помощь при рождении ребёнка.
  • Партнерская программа «Зелёный свет»: за рекомендации знакомых специалистов можно получить до 50 000 руб.
Описание

ТехВилл – IT-компания и партнёр ВкусВилл по развитию цифровых решений.

Мы отвечаем за разработку мобильных и web- приложений, автоматизацию бизнес-процессов, искусственный интеллект, devops, инфобез ВкусВилла.

Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.

Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.

Обязанности:

  • Поддержка сервисов и команд разработки со стороны инфраструктуры;
  • Обеспечение надежности и масштабируемости систем;
  • Выявление и устранение узких мест в производительности;
  • Настройка систем мониторинга, логирования и трейсинга;
  • Предотвращение потенциальных сбоев;
  • Оптимизация CI/CD пайплайнов, внедрение инфраструктуры как код (IaC) и автоматизация рутинных задач;
  • Продвижение практик DevOps в сторону разработки: внедрение best practices DevOps, таких как мониторинг SLA, SLO, SLI, анализ инцидентов (postmortem) и управление изменениями;
  • Участие в создании и развитии инфраструктурных платформ;
  • Обеспечение безопасности, надежности, отказоустойчивости и быстрого восстановления после сбоев платформы.

Требования:

  • Практический опыт в администрировании и поддержки информационных систем семейства Linux (Debian, Ubuntu, Rocky);
  • Владение bash или python как инструментарием для автоматизации рутинной деятельности;
  • Практический опыт применения систем оркестрации контейнеров (Kubernetes, Docker compose);
  • Практический опыт работы с контейнерами (Docker), знание основ построения Dockerfile и лучших практик в этой области;
  • Владение системами управления конфигурациями (Ansible, Terraform, Pulumi) и практический опыт применения таких систем в процессах построения IaC (Infrastructure as Code;
  • Применение инструментов GitLab CI и Jenkins в построении процессов сборки и доставки;
  • Практический опыт применения и администрирования систем мониторинга на базе Prometheus, Zabbix, Grafana Stack, Alertmanager, VictoriaMetrics;
  • Практический опыт взаимодействия с системами потоковой передачи событий (Kafka, RabbitMQ);
  • Знание методологий Agile, опыт работы в тикетных системах (Yandex Tracker и др.) и системах хранения документации (Evawiki и другие Wiki);
  • Практический опыт эксплуатации веб-серверов и балансировщиков нагрузки (Nginx, HAProxy, Traefik, APISIX);
  • Практический опыт администрирования систем управления реляционными базами данных (PostgreSQL, Greenplum, MySQL), кластеризации на базе Patroni, а также колоночной СУБД ClickHouse;
  • Практический опыт применения NoSQL и Key-Value систем (Elasticsearch, OpenSearch, etcd, Redis, Memcached);
  • Практический опыт применения систем централизованного сбора и хранения логов на базе стеков: Logstash, Vector, Graylog, Loki;
  • Практический опыт применения систем объектного хранения на базе S3 (MinIO), а также инструментов доступа к ним;
  • Навыки работы с облачными системами (Yandex Cloud, Cloud.ru) и системами управления ими;
  • Практический опыт оркестрации пайплайнов обработки данных на базе Apache Airflow;
  • Опыт развертывания и сопровождения JupyterHub
  • Владение инструментарием распределённой обработки данных (Apache Spark, Spark Streaming);
  • Опыт работы с Iceberg REST Catalog как каталогом табличных данных;
  • Практический опыт применения MLflow для отслеживания экспериментов, регистрации моделей и управления их жизненным циклом;
  • Знакомство с векторными базами данных (Qdrant) в составе ML-платформы;
  • Знакомство с платформой автоматизации процессов на базе n8n;
  • Понимание/опыт развёртывания и эксплуатации LLM‑моделей на GPU (Triton Inference Server, vLLM, TensorRT‑LLM или аналоги);
  • Знание GPU‑мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink;
  • Опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV‑cache;
  • Управление ресурсами GPU в K8s: HAMi, MIG, time‑slicing, квотирование;
  • Понимание работы с NVDEC/NVENC;
  • Практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling → validation;
  • Опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами.

Условия:

  • Работу в аккредитованной IT-компании.
  • Удалённая работа: для нас важны результаты работы без привязки к месту;
  • Официальное оформление с первого дня работы и поддержка куратора во время адаптации.
  • Прозрачная система развития: понятные грейды, внутреннее и внешнее обучение, индивидуальные планы развития и матрицы компетенций.
  • Экологичная культура и адекватные руководители.
  • Компенсация затрат на медицинские услуги, ментальное благополучие, спорт, тимбилдинги и использование AI-помощников.
  • Бонус 15% с покупок во ВкусВилл.
  • Социальная ответственность: поощряем донорство, оказываем материальную помощь при рождении ребёнка.
  • Партнерская программа «Зелёный свет»: за рекомендации знакомых специалистов можно получить до 50 000 руб.

Похожие вакансии

Менеджер по логистике
Волкова Елена Сергеевна
от 70000 руб.
Полная занятостьОпыт не требуется
Ведущий системный аналитик
КБ Уральский банк реконструкции и развития (УБРиР)
Зарплата не указана
Полная занятостьОпыт 1–3 года
Оператор чат-поддержки 2-ой линии (ночной график)
IT SCOUT(match)
Зарплата не указана
Полная занятостьОпыт 1–3 года
Technical Support Manager
Green Fresh (Fujian) Foodstuff Co., Ltd.
2000 – 3000 $
Полная занятостьОпыт 3–6 лет
Руководитель отдела маркетинга и рекламы
Staffberry
от 200000 руб.
Полная занятостьОпыт 3–6 лет
Инфлюенсер/контент креатор/блогер/UGC креатор
Hikee
25000 – 100000 руб.
Полная занятостьОпыт 1–3 года