Мы находимся на пике роста и прямо сейчас в поиске системного администратора.
Чем предстоит заниматься:
- Установка, настройка и обслуживание серверного оборудования (x86, GPU-серверы), систем хранения данных и сетевого оборудования.
- Администрирование сред виртуализации: VMware vSphere (ESXi, vCenter) и zVirt (платформа на базе oVirt).
- Управление ресурсами ВМ, настройка высокой доступности (HA), миграция (vMotion/Live Migration), работа со снапшотами и бэкапами.
- Проброс аппаратных ускорителей (PCIe Passthrough, SR-IOV, vGPU) в виртуальные машины.
- Развертывание, масштабирование и траблшутинг кластеров Kubernetes (On-premise).
- Подготовка и поддержка GPU-узлов в K8s: установка драйверов, настройка NVIDIA Container Toolkit / NVIDIA Device Plugin.
- Управление системами хранения для ML-задач: подключение высокоскоростных хранилищ (NFS, Ceph, Lustre или блочные СХД) к подам Kubernetes (CSI) для хранения тяжелых датасетов и чекпоинтов моделей.
- Обеспечение сетевой связности в кластере (Ingress, Network Policies, балансировка).
- Мониторинг инфраструктуры и ML-ворклоадов: настройка стека Prometheus + Grafana, сбор логов (ELK/EFK/Loki), контроль утилизации GPU (DCGM Exporter).
- Взаимодействие с командами Data Science и MLOps: помощь в упаковке моделей в контейнеры, выделение квот, решение проблем с нехваткой ресурсов.
Чтобы у нас все получилось, тебе нужны: