LlmOps-DevOps

Cloud.ru
Москва •Опубликовано 1 сентября 2026
Зарплата не указана
Полная занятость3–6 летПрограммист
Зарплата не указана

Описание

Обязанности:

  • Развертывание и эксплуатация LLM:
    - Запуск и масштабирование больших языковых моделей (LLM) в продакшн-среде (инференс-кластеры).
    - Реализация техник оптимизации: квантизация (GPTQ, AWQ), vLLM, TensorRT-LLM, speculative decoding для снижения задержек (latency) и увеличения пропускной способности (throughput).
    - Настройка автоматического масштабирования (autoscaling) инференс-эндингов в зависимости от нагрузки.

  • Поддержка и развитие ML-архитектуры:

    - Сопровождение и рефакторинг текущей архитектуры ML Inference.
    - Разработка и поддержка платформенных решений для бесшовного переключения между разными моделями (A/B тестирование, канареечные деплои).
  • Сетевая инфраструктура для продуктов:
    - Проектирование и настройка высокоскоростной сетевой связности между GPU-кластерами (NVIDIA NCCL), объектным хранилищем (S3) и приложениями.
    - Настройка Service Mesh (Istio) и Ingress-контроллеров для маршрутизации трафика к AI-сервисам с учетом требований безопасности.
    - Обеспечение сетевой изоляции (VPC, Security Groups) для тенантов, работающих с чувствительными данными.

Требования:

  • Продвинутый опыт с Kubernetes (Helm, Kustomize, операторы).

  • Опыт работы с GPU-оператором (NVIDIA GPU Operator) и настройкой node-пулов с различными типами GPU (A100, H100, и др).

  • Уверенное владение инструментами для управления инфраструктурой как кодом (IaC). - Опыт развертывания LLM в продакшн с использованием vLLM, Sglang.

  • Понимание техник оптимизации: квантизация (FP8, INT4/8), пакетная обработка (continuous batching), управление KV-cache.

  • Глубокое понимание работы CNI (Cilium) в Kubernetes.

  • Глубокое знание сетевой модели OSI, TCP/IP стека;

  • Опыт администрирования Unix-подобных ОС;

  • Опыт написания скриптов для автоматизации (Bash, Python);

  • Опыт администрирования веб-серверов, понимание протокола HTTP;

  • Опыт администрирования Open Source баз данных (Postgresql, Clickhouse и т.д.);

  • Практические знания и опыт в построении архитектуры, разработке и внедрении CI/CD решений;

  • Уверенное владение DevOps инструментами для сборки и развертывания приложений (Gitlab), опыт интеграции и настройки инструментов контроля и тестирования;

  • Опыт настройки и интеграции систем хранения секретов (Vault);

  • Владение Python/Go.

  • Большим преимуществом будет умение работать в Envoy - в частности его настройка и расширение при помощи extproc;

  • Опыт администрирование BareMetal серверов.

Описание

Обязанности:

  • Развертывание и эксплуатация LLM:
    - Запуск и масштабирование больших языковых моделей (LLM) в продакшн-среде (инференс-кластеры).
    - Реализация техник оптимизации: квантизация (GPTQ, AWQ), vLLM, TensorRT-LLM, speculative decoding для снижения задержек (latency) и увеличения пропускной способности (throughput).
    - Настройка автоматического масштабирования (autoscaling) инференс-эндингов в зависимости от нагрузки.

  • Поддержка и развитие ML-архитектуры:

    - Сопровождение и рефакторинг текущей архитектуры ML Inference.
    - Разработка и поддержка платформенных решений для бесшовного переключения между разными моделями (A/B тестирование, канареечные деплои).
  • Сетевая инфраструктура для продуктов:
    - Проектирование и настройка высокоскоростной сетевой связности между GPU-кластерами (NVIDIA NCCL), объектным хранилищем (S3) и приложениями.
    - Настройка Service Mesh (Istio) и Ingress-контроллеров для маршрутизации трафика к AI-сервисам с учетом требований безопасности.
    - Обеспечение сетевой изоляции (VPC, Security Groups) для тенантов, работающих с чувствительными данными.

Требования:

  • Продвинутый опыт с Kubernetes (Helm, Kustomize, операторы).

  • Опыт работы с GPU-оператором (NVIDIA GPU Operator) и настройкой node-пулов с различными типами GPU (A100, H100, и др).

  • Уверенное владение инструментами для управления инфраструктурой как кодом (IaC). - Опыт развертывания LLM в продакшн с использованием vLLM, Sglang.

  • Понимание техник оптимизации: квантизация (FP8, INT4/8), пакетная обработка (continuous batching), управление KV-cache.

  • Глубокое понимание работы CNI (Cilium) в Kubernetes.

  • Глубокое знание сетевой модели OSI, TCP/IP стека;

  • Опыт администрирования Unix-подобных ОС;

  • Опыт написания скриптов для автоматизации (Bash, Python);

  • Опыт администрирования веб-серверов, понимание протокола HTTP;

  • Опыт администрирования Open Source баз данных (Postgresql, Clickhouse и т.д.);

  • Практические знания и опыт в построении архитектуры, разработке и внедрении CI/CD решений;

  • Уверенное владение DevOps инструментами для сборки и развертывания приложений (Gitlab), опыт интеграции и настройки инструментов контроля и тестирования;

  • Опыт настройки и интеграции систем хранения секретов (Vault);

  • Владение Python/Go.

  • Большим преимуществом будет умение работать в Envoy - в частности его настройка и расширение при помощи extproc;

  • Опыт администрирование BareMetal серверов.

Похожие вакансии

Помощник/ассистент руководителя
DaVinci
от 45000 руб.
Полная занятостьОпыт не требуется
Менеджер по продукту (координатор команды)
Оптимакрос
Зарплата не указана
Полная занятостьОпыт 1–3 года
Менеджер по продажам
Семенов Антон Петрович
80000 – 150000 руб.
Полная занятостьОпыт 1–3 года
Дизайнер по обработке фотографий
Гасанов Руслан Абидипович
от 50000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по продажам в онлайн-школу
Егорова Дарья Ивановна
от 130000 руб.
Полная занятостьОпыт 1–3 года
Координатор производства детских AI-книг
SunRoom - браслеты из натуральных камней
50000 – 70000 руб.
Полная занятостьОпыт 1–3 года