Linux-инженер (сопровождение on-premise AI-платформы)

Группа IT-компаний Lad
Нижний Новгород •Опубликовано 1 октября 2026
Зарплата не указана
Полная занятость3–6 летПрограммист
Зарплата не указана

Описание

Мы — группа IT-компаний Lad: 34 года помогаем бизнесу автоматизировать процессы и внедрять новые технологии, более 500 специалистов в команде. В 2025 году вошли в ТОП-100 работодателей России и заняли 1 место среди IT-компаний Нижегородской области.

Ladcraft — платформа автономных ИИ-агентов для бизнеса. Разворачивается на серверах заказчика в изолированной сети, без доступа в интернет, и работает в Kubernetes; часть инсталляций использует локальный инференс моделей на GPU. Ваша задача — обеспечивать стабильную работу этой инфраструктуры.

Чем предстоит заниматься:

  • Анализировать логи и метрики заказчиков: системные логи, логи сервисов, дашборды Grafana, метрики Prometheus.
  • Обновлять компоненты по инструкциям от команды разработки: пакеты, сервисы, бандлы.
  • Готовить хосты к установке: базовая настройка ОС (Альт Сервер 10.4 / Debian / Ubuntu / Astra SE 1.7, 1.8), проверка ресурсов, сети и файловых систем.
  • Настраивать и диагностировать GPU: доступность видеокарт, драйверы, распределение видеопамяти между LLM-моделями, контроль температур и загрузки.
  • Разбирать инциденты в Kubernetes: падающие поды, нехватка ресурсов, OOMKill, CrashLoopBackOff, проблемы с Ingress, ConfigMaps, Secrets, PVC.
  • Локализовать лёгкие и средние инциденты, применять типовые решения и эскалировать с полным контекстом: логи, метрики, шаги, гипотезы.
  • Взаимодействовать с DevOps и разработкой, готовить репродукции проблем.
  • Общаться с заказчиком в чатах и по почте: собирать данные по инциденту, согласовывать окна обновлений, отчитываться о результатах.
  • Развертывать платформу в закрытых контурах.
  • Первоначальная настройка контура.

Что мы ожидаем:

  • Linux на уровне уверенного пользователя: процессы и нагрузка, службы, файловые системы и сетевые соединения.
  • Уверенное владение Kubernetes: архитектура кластера, работа с kubectl, диагностика подов, понимание Ingress, Services, ConfigMaps, Secrets, PVC/StorageClass, ResourceQuota, HPA. Умение читать манифесты и понимать, что в них не так.
  • Понимание сетей: TCP/UDP, DNS, MTU, базовая диагностика.
  • Опыт работы с мониторингом: Prometheus, Grafana, Loki — чтение дашбордов, поиск аномалий.
  • Понимание HTTP-кодов ошибок (502, 504) и их причин в инфраструктуре с прокси и балансировщиком.
  • Базовый bash для простых скриптов диагностики.
  • Понимание принципов systemd: unit-файлы, зависимости, статусы служб.
  • Понимание работы локального инференса: видеопамять и требования моделей, диагностика нехватки видеопамяти, знакомство с утилитами мониторинга GPU.
  • Умение самостоятельно выстраивать план диагностики: ОС → Kubernetes → приложение → сеть.
  • Коммуникационные навыки: чётко формулировать вопросы, собирать нужные данные и объяснять статус и дальнейшие шаги инженерам и руководителям проектов заказчика.
  • Готовность вовремя признавать незнание и эскалировать, спокойствие в инцидентах: сначала факты, потом действия.

Мы предлагаем:

  • Официальное трудоустройство, полная занятость.
  • Удалённый формат работы, в Нижнем Новгороде возможен гибрид.
  • Гибкое начало рабочего дня (9:00–11:00 по МСК).
  • Команда разработки и DevOps рядом: помогают, но ожидают самостоятельности в своей зоне.
  • Обучение и развитие: Lad Универ, внешние тренинги и митапы, выстроенный онбординг, индивидуальный план развития.
  • ДМС, чекапы, компенсация спорта.
  • Оплачиваемый выходной в день рождения, магазин мерча.
Описание

Мы — группа IT-компаний Lad: 34 года помогаем бизнесу автоматизировать процессы и внедрять новые технологии, более 500 специалистов в команде. В 2025 году вошли в ТОП-100 работодателей России и заняли 1 место среди IT-компаний Нижегородской области.

Ladcraft — платформа автономных ИИ-агентов для бизнеса. Разворачивается на серверах заказчика в изолированной сети, без доступа в интернет, и работает в Kubernetes; часть инсталляций использует локальный инференс моделей на GPU. Ваша задача — обеспечивать стабильную работу этой инфраструктуры.

Чем предстоит заниматься:

  • Анализировать логи и метрики заказчиков: системные логи, логи сервисов, дашборды Grafana, метрики Prometheus.
  • Обновлять компоненты по инструкциям от команды разработки: пакеты, сервисы, бандлы.
  • Готовить хосты к установке: базовая настройка ОС (Альт Сервер 10.4 / Debian / Ubuntu / Astra SE 1.7, 1.8), проверка ресурсов, сети и файловых систем.
  • Настраивать и диагностировать GPU: доступность видеокарт, драйверы, распределение видеопамяти между LLM-моделями, контроль температур и загрузки.
  • Разбирать инциденты в Kubernetes: падающие поды, нехватка ресурсов, OOMKill, CrashLoopBackOff, проблемы с Ingress, ConfigMaps, Secrets, PVC.
  • Локализовать лёгкие и средние инциденты, применять типовые решения и эскалировать с полным контекстом: логи, метрики, шаги, гипотезы.
  • Взаимодействовать с DevOps и разработкой, готовить репродукции проблем.
  • Общаться с заказчиком в чатах и по почте: собирать данные по инциденту, согласовывать окна обновлений, отчитываться о результатах.
  • Развертывать платформу в закрытых контурах.
  • Первоначальная настройка контура.

Что мы ожидаем:

  • Linux на уровне уверенного пользователя: процессы и нагрузка, службы, файловые системы и сетевые соединения.
  • Уверенное владение Kubernetes: архитектура кластера, работа с kubectl, диагностика подов, понимание Ingress, Services, ConfigMaps, Secrets, PVC/StorageClass, ResourceQuota, HPA. Умение читать манифесты и понимать, что в них не так.
  • Понимание сетей: TCP/UDP, DNS, MTU, базовая диагностика.
  • Опыт работы с мониторингом: Prometheus, Grafana, Loki — чтение дашбордов, поиск аномалий.
  • Понимание HTTP-кодов ошибок (502, 504) и их причин в инфраструктуре с прокси и балансировщиком.
  • Базовый bash для простых скриптов диагностики.
  • Понимание принципов systemd: unit-файлы, зависимости, статусы служб.
  • Понимание работы локального инференса: видеопамять и требования моделей, диагностика нехватки видеопамяти, знакомство с утилитами мониторинга GPU.
  • Умение самостоятельно выстраивать план диагностики: ОС → Kubernetes → приложение → сеть.
  • Коммуникационные навыки: чётко формулировать вопросы, собирать нужные данные и объяснять статус и дальнейшие шаги инженерам и руководителям проектов заказчика.
  • Готовность вовремя признавать незнание и эскалировать, спокойствие в инцидентах: сначала факты, потом действия.

Мы предлагаем:

  • Официальное трудоустройство, полная занятость.
  • Удалённый формат работы, в Нижнем Новгороде возможен гибрид.
  • Гибкое начало рабочего дня (9:00–11:00 по МСК).
  • Команда разработки и DevOps рядом: помогают, но ожидают самостоятельности в своей зоне.
  • Обучение и развитие: Lad Универ, внешние тренинги и митапы, выстроенный онбординг, индивидуальный план развития.
  • ДМС, чекапы, компенсация спорта.
  • Оплачиваемый выходной в день рождения, магазин мерча.

Похожие вакансии

Менеджер по логистике
Волкова Елена Сергеевна
от 70000 руб.
Полная занятостьОпыт не требуется
Менеджер по развитию ключевых клиентов / Customer Success Manager
Data Light
150000 – 200000 руб.
Полная занятостьОпыт 3–6 лет
AI-креатор (фото и видео)
Профессиональные Люди
150000 – 300000 руб.
Полная занятостьОпыт не требуется
Визовый специалист
Голубицкая Алёна Дмитриевна
60000 – 250000 руб.
Полная занятостьОпыт 1–3 года
Системный администратор
ГАУ Архангельской области Центр детского отдыха Северный Артек
от 16000 руб.
Полная занятостьОпыт 3–6 лет
SMM-менеджер
АНО АйдаСпорт
20000 – 50000 руб.
Полная занятостьОпыт не требуется