Вакансия для Москвы, Санкт-Петербурга и Нижнего Новгорода. Работать из других городов России не представляется возможным. Редкие поездки в офис, только для общих собраний. Условия: - Работа в высоконагруженных системах, на платформе с bare metal и минимальным количеством облаков/виртуализации; - Нормированный рабочий день, с отработкой инцидентов без дежурств, с 10:00 до 19:00 по мск; - Выстроенные рабочие процессы, документация; - Работа из дома (СПБ, МСК, НиНо), на оборудовании от Криптонит; - Возможность бронировать рабочее место в офисах компании (СПБ, МСК, НиНо); - ДМС с первого рабочего дня (стоматология, скорая помощь, прямой доступ); - Трудоустройство и соц.выплаты по ТК РФ; - Годовая премия по итогам работы года; - Онбординг на 3 месяца, с прозрачными метриками/задачами; - Performance Review 2 раза в год, с созданием ИПР и пересмотром ЗП; - Состав команды опытный и отзывчивый: middle и senior грейды; Техническое окружение: Core Platform Infra -Kubernetes: Знание K8s (Deployment, Service Mesh), способность проводить deep networking и resource debugging. -Helm: Шаблонинг, библиотеки, деплой через helmfile/helmwave -CI/CD: Настройка/дебаг пайплайнов GitLab CI Observability Stack -Metrics: Prometheus VictoriaMetrics (знание архитектурных различий и масштабирования). Владение PromQL (сложные запросы, агрегации, rate calculations). -Logs: VictoriaLogs / ELK . -Tracing OTel: Знание концепции трассировки и OpenTelemetry. Умение работать с OpenTelemetry Collector. -Visualization: Grafana (построение сложных дашбордов из нескольких источников данных: PromQL, ViktoriaLogs, Jaeger). Development Automation Skills -Python: Написание простой автоматизации или небольших api сервисов, автоматизации задач мониторинга и взаимодействия с API. -GoLang (Желательно): Знание Go — большое преимущество для работы с производительными компонентами стека (Operators, Collectors). Обязанности: Настройка и управление мониторинг стеком; Помощь в написании алертов для продуктовых команд; Помощь с non-Prod окружениями в вопросах мониторинга, логирования и трейсинга; Создание артефактов для обновления систем мониторинга, логирования и трейсинга на Prod окружениях. Поддержка ci/cd для продуктовых команд. Разработка сервисов для мониторинга.